Issue 01중국 AI
AC POST
중국 AI 목록
开源中国2026년 9월 21일 21:40중국어 → 한국어

Rust와 Qwen3Guard로 구축한 이중 보안 리스크 관리

Rust 저수준 차단과 Qwen3Guard AI 다국어 의미 판단을 결합한 이중 보안 아키텍처의 설계와 구현 경험, 공개 벤치마크, 능력 한계를 다룬 글이다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

이 글은 55873 생태계 기술 백서 제4편 —— 이중 계층 안전 리스크 통제 아키텍처이다. 프로덕션 환경에서 우리가 구현한 Rust 저계층 하드 차단 + Qwen3Guard AI 다국어 의미 판단의 이중 계층 아키텍처 설계를 완전히 해부하며, 여기에는 우리가 겪은 시행착오, 공개 벤치마크 데이터, 그리고 능력 경계에 대한 정직한 공개가 포함된다.

개요

프로젝트 포지셔닝: 이중 계층 안전 리스크 통제 = Rust 저계층 하드 차단 + Qwen3Guard AI 의미 판단

핵심 기술 스택: Rust 컴파일형 엔진 + Qwen3Guard 다국어 가드레일 모델 + 3계층 방어 아키텍처

예상 읽기 시간: 약 10분

적합 대상: 백엔드 개발자, 보안 엔지니어, 아키텍트

一、왜 우리는 이중 계층 안전 리스크 통제를 하려 하는가?

55873 안전 리스크 통제는 Rust 저계층 기계 수준 하드 차단 + Qwen3Guard AI 다국어 의미 판단의 이중 계층 아키텍처를 채택한다.

첫 번째 계층: Rust 저계층 하드 차단

- 컴파일형 저계층 엔진으로, 요청이 비즈니스 링크에 진입하기 전에 명시적 위반 콘텐츠를 강제 차단한다 - 커버 범위: 키워드 필터링, 위반 문자 탐지, 악성 형식 차단, 스크립트 주입 차단, 스팸 콘텐츠 필터링

두 번째 계층: Qwen3Guard AI 의미 판단

- 통이첸원 Qwen3 기반 아키텍처를 특별 미세조정한 안전 가드레일 모델 - 커버 범위: 암시적 위반, 유도 화법, 다중 턴 탈옥, 다국어 은닉 위반

핵심 설계 원칙

원칙

설명

강제 이중 심사

모든 사용자 입력은 반드시 두 계층 심사를 완전히 거쳐야 하며, 화이트리스트나 면제 인터페이스, 우회 통로는 존재하지 않는다

계층 분리

Rust 계층과 AI 계층은 독립적으로 배치되며, 단일 계층 장애가 확산되지 않고 명확한 성능 저하(디그레이드) 전략을 갖는다

정량적 검증 가능

각 계층은 모두 명확한 지연, 정확도, 오탐 차단율, 탈옥 통과율 지표를 가지며, 공개 벤치마크를 인용한다

다국어 전면 커버

Qwen3Guard는 119개 언어 및 방언을 지원하며, 55873의 7개국 언어 체계를 커버한다

경계의 정직한 공개

Qwen3Guard의 궤적(trajectory) 수준 위험 탐지에서의 구조적 단점을 정량적으로 공개하고, 명확한 보상 방안을 갖는다

이중 계층 아키텍처 공개 실증 데이터

데이터 소스

핵심 지표

ChatTEDU (IEEE Access 2025)

100% 차단, 0.28% 오탐, 18% 지연 오버헤드

4,501건 실제 상호작용, 180건 악의적 시도

Glean 이중 모델 아키텍처

97.8% 정확도

탈옥 탐지 정확도가 단일 모델 방안보다 높음

NeurIPS 2024 논문

이중 계층 아키텍처 유효성 검증

외부 판정 계층이 모델 내부 안전 시스템에서 "안전"으로 잘못 표기된 위반 콘텐츠를 발견

二、Rust 저계층 보안: 우리는 왜 Rust를 선택했는가?

rust_security_engine은 Rust 언어로 개발되었으며, 컴파일 시점 메모리 안전 보장과 제로 비용 추상화(zero-cost abstraction) 특성을 활용하여 고처리량, 저지연의 저계층 보안 필터링 계층을 구축한다.

3계층 방어 아키텍처

기본 규칙 계층: 순수 Rust 구현, 마이크로초 수준 스캔

- 커버 범위: prompt 인젝션, 역할 덮어쓰기, 키 유출, PII, IDN 동형이의자, 보이지 않는 텍스트, Markdown 밀수 - 기본 배포

퍼지 매칭 계층: trigram 포함 탐지, 마이크로초 수준 지연

- 재작성/의역 유형 공격 식별에 사용 - 선택적 활성화

ML 강화 계층: ONNX 분류기, CPU P99 약 3-10ms

- 재작성 공격 또는 신종 공격 탐지에 사용 - 비즈니스 시나리오에 따라 선택적으로 활성화

공개 성능 베이스라인 (zentinel-modsec 수정 후 벤치마크)

벤치마크 항목

Rust

C++

가속비

정상 요청 처리

1.34 µs

5.65 µs

4.2x

SQLi 탐지

1.40 µs

16.03 µs

11.5x

요청 본문 처리

1.45 µs

12.91 µs

8.9x

복잡 규칙 파싱

2.73 µs

10.58 µs

3.9x

정상 요청 처리량

676K req/s

168K req/s

4.0x

공격 요청 처리량

701K req/s

62K req/s

11.3x

⚠️

중요 설명

: zentinel-modsec 팀은 이전에 부풀려진 벤치마크 데이터를 공개적으로 정정했다 —— 이전에 보고된 "10–30x"와 "6.2M req/s"는 규칙 단계가 Rust 측에서 실행되지 않은 측정 오류에서 비롯된 것이었다. 수정 후 데이터는 4–11x이다. 우리는 수정 후 데이터를 견고한 베이스라인으로 삼으며, 인터넷에서 하늘까지 치솟듯 떠드는 데이터에 속지 말자.

설계 목표

지표

목표값

P99 필터링 지연

≤ 1ms

규칙 계층 + 선택적 퍼지/ML 계층 포함

단일 인스턴스 QPS

≥ 50,000

순수 규칙 계층 모드

차단 정확도

≥ 99%

알려진 공격 벡터 대상

오탐 차단율

≤ 0.1%

정상 비즈니스 요청 대상

규칙 라이브러리 핫 업데이트

재시작 없이 적용

동적 규칙 로딩 지원

三、Qwen3Guard 의미 판단: 단일 턴 SOTA, 그러나 궤적 수준에는 단점이 있다

ai_judge_engine은 Qwen3Guard 다국어 안전 가드레일 모델에 의존한다. Qwen3Guard는 Qwen3-8B 백본을 기반으로, 119개 언어, 119만 건의 prompt-response 샘플에서 미세조정되었으며, 3분류 안전 분류(safe / controversial / unsafe)를 채택한다.

단일 턴 프롬프트/응답 분류의 공개 SOTA 데이터

벤치마크

Qwen3Guard-8B

비교 모델

리드 폭

영어 프롬프트 분류 (Avg F1)

90.0

SOTA

중국어 프롬프트 분류 (Avg F1)

85.1

PolyGuard-Qwen-7B: 68.4

+16.7

중국어 응답 분류 (Avg F1)

87.1

비교 모델: 62.5

+24.6

아랍어 SalamahBench

90.8%

Llama Guard 4: 83.3%

+7.5%

아랍어 AraSafe

88.7%

Aya Expanse 32B: 91.0%

유의미한 차이 없음

반드시 정직하게 공개해야 하는 공개 벤치마크 경계: 다단계 궤적 위험 탐지 단점

Guard 모델

Avg-F1

Acc

Safe-F1

Unsafe-F1

14.63

17.01

28.88

0.38

LlamaGuard3-8B

38.34

38.63

34.13

42.56

PolyGuard

36.45

36.72

32.31

40.60

ShieldGemma-9B

28.09

28.30

31.98

24.20

ShieldAgent

65.49

86.01

38.89

92.10

AgentDog-Qwen-7B

47.60

80.45

6.11

80.09

핵심 발견 : Qwen3Guard-8B의 Unsafe-F1은 0.38에 불과하며, 이는 궤적 수준의 불안전 콘텐츠를 거의 식별하지 못한다는 것을 의미한다.

보상 방안

model_eval 궤적 수준 감사: HINTBench 표준화 벤치마크를 사용하여 사유화 모델에 대한 궤적 수준 안전 평가를 수행

조합 아키텍처: 다단계 작업 실행이 관련된 시나리오에서 Qwen3Guard는 단일 턴 분류를 담당

- 추가로 ShieldAgent 계열 모델을 배치하여 상호 보완

강제 이중 심사 보완: Rust 하드 차단 계층이 궤적 내 각 단계에 대해 독립적으로 강제 규칙 검증을 수행

- "단계별 하드 차단 + 전체 의미 판단"의 종심 방어를 형성

四、전 사이트 강제 심사: 화이트리스트도, 면제 인터페이스도 없다

플랫폼 규칙: 사용자가 제출한 텍스트, 게시물, 다이렉트 메시지, 파일 업로드, AI 대화 입력은 전부 이중 계층 안전 심사를 강제로 거친다. 화이트리스트, 면제 인터페이스는 존재하지 않는다.

심사 링크

사용자 입력 → business_scheduler 수신 → rust_security 3계층 방어 → 통과

- → ai_judge Qwen3Guard 의미 판단 → 통과 → 비즈니스 링크 진입

어느 한 계층이라도 차단 → 안전 거절 반환

OWASP LLM Top 10 정렬 및 공개 테스트 데이터

테스트 항목

공개 결과

출처

Prompt Injection 순위

#1 (2025, 2023년 이래 불변)

OWASP LLM Top 10

인젝션 탐지 재현율

97.0% (32/33)

공개 WAF 스코어카드

인젝션 탐지 정밀도

97.0%

상동

인젝션 탐지 오탐률

2.3% (1/44)

최고 단일 탐지기 정확도

83.5%

공개 평가

앙상블 탐지(다수결 투표) 정확도

87.6%

Llama 3.1 8B 공격 성공률

64–76%

garak 레드팀 테스트

: 공개 평가에 따르면 어떤 단일 prompt 인젝션 탐지기도 83.5%를 넘지 못하며, 앙상블 탐지(다수결 투표)는 87.6%에 도달한다. 55873의 이중 계층 아키텍처는 본질적으로 이기종 앙상블 탐지이다 —— Rust 규칙 계층 + Qwen3Guard 의미 계층, 두 계층은 완전히 다른 탐지 메커니즘을 채택하여, 동형 모델의 다수결 투표 앙상블보다 상호 보완성이 높다.

五、탈옥 방지, 인젝션 방지, 남용 방지: 우리가 겪은 시행착오

1. Prompt 인젝션 방어

직접 인젝션 방어: 사용자 입력에 전처리, 경계 검증을 수행하여 사용자가 모델 지시를 변조하지 못하도록 차단

간접 인젝션 방어: 모든 콘텐츠(문서, 웹페이지, 도구 출력, 검색 단락)를 잠재적 적대적 콘텐츠로 취급

- 모델 컨텍스트에 진입하기 전에 구분, 분리 또는 표기

최소 권한 원칙: 모델 권한을 기능에 필요한 최소 범위로 한정

2. 모델 탈옥 억제

Qwen3Guard는 탈옥 유형 프롬프트를 식별하고, 권한 초월 및 위반 출력을 차단

탈옥 테스트 세트는 HarmBench 표준화 프로토콜 기반 (UC Berkeley, Google DeepMind와 Center for AI Safety 공동 발표, 400+종 유해 행위 커버)

다중 턴 대화 리스크 통제: 다중 턴 컨텍스트를 지속 추적하여 점진적 유도 유형 위반 식별

3. 다중 턴 탈옥: 반드시 공개해야 하는 위협 모델 경계

NeurIPS 2024 논문은 지적한다: 다중 턴 수동 탈옥은 HarmBench에서 한 자릿수 ASR을 보고한 방어 시스템에 대해 70%를 넘는 공격 성공률을 달성할 수 있다. 이는 단일 턴 자동화 공격의 방어 효과를 다중 턴 수동 공격 시나리오로 외삽할 수 없다는 것을 의미한다.

55873의 세션 수준 리스크 누적 메커니즘과 다중 턴 대화 리스크 통제는 설계상 이 위협을 겨냥하지만, 백서에서 "다중 턴 탈옥"을 지속 모니터링 중인 위협 모델로 명확히 표기하고, 정기적으로 HarmBench 다중 턴 프로토콜로 재측정해야 한다.

4. 안전 재측정과 정량 검증

테스트 유형

테스트 세트

통과율 목표

탈옥 탐지

HarmBench (400+ 유해 행위, 표준화 프로토콜)

≥ 95%

Prompt 인젝션 차단

OWASP 인젝션 페이로드 세트, Garak

≥ 98%

다국어 안전

7개국 언어별 테스트 세트

각 언어 ≥ 95%

아랍어 전용

SalamahBench + AraSafe + Arabizi 전용

MSA ≥ 90%, Arabizi 별도 표기

다단계 궤적 위험

HINTBench 표준화 벤치마크

궤적 수준 Avg-F1 별도 보고

다중 턴 수동 탈옥

HarmBench 다중 턴 프로토콜 / MHJ 데이터셋

지속 모니터링, ASR 별도 보고

六、업계 비교와 컴플라이언스 매핑

업계 우위

시중 대다수 AI 플랫폼은 단일 AI 대형 모델에만 의존해 콘텐츠 심사를 하며, 저계층 키워드 하드 차단이 결여되어 있다. 55873은 Rust 저계층 하드 방어(전체 수명 주기 4–11배 처리량 우위) + Qwen3Guard AI 의미 소프트 방어(119개 언어, 단일 턴 분류 SOTA)의 이중 계층 폐루프를 채택한다.

공개 평가 데이터에 따르면 어떤 단일 prompt 인젝션 탐지기도 83.5%를 넘지 못하며, 앙상블 탐지는 87.6%에 도달한다. 55873의 이중 계층 아키텍처는 이기종 앙상블 탐지이다 —— Rust 규칙 계층과 Qwen3Guard 의미 계층은 완전히 다른 탐지 메커니즘을 채택하여 동형 모델 앙상블보다 상호 보완성이 높다.

동시에 55873은 Qwen3Guard의 HINTBench 궤적 수준 위험 탐지에서의 정량적 단점(Unsafe-F1 0.38)을 정직하게 공개하고, model_eval 궤적 수준 감사, ShieldAgent 계열 모델 조합 아키텍처, 강제 이중 심사 보완의 세 가지 보상 방안을 설계했다.

컴플라이언스 매핑

법규/표준

관련 조항

55873 정렬 조치

OWASP LLM Top 10 (2025)

LLM01 Prompt Injection

강제 이중 심사, trusted/untrusted 구조적 분리

LLM07 System Prompt Leakage

입력 전처리, 경계 검증, 시스템 프롬프트 버전 관리

등급보호 2.0 3급

보안 감사 로그는 180일 이상 보관

감사 로그는 독립적으로 보존되어 변조 방지, 추적 가능

NIST AI RMF 1.0

Govern / Map / Measure / Manage

이중 계층 리스크 통제를 AI 리스크 관리 프레임워크에 포함

EU AI Act

고위험 시스템의 사이버 보안 및 견고성 요구사항

이중 계층 보안 아키텍처가 견고성과 사이버 보안을 뒷받침

생성형 AI 서비스 관리 방안

콘텐츠 안전 심사

전 사이트 강제 이중 심사, 우회 경로 없음

마지막으로

이중 계층 리스크 통제는 55873 생태계 보안 기반의 핵심이다. Rust 저수준 엔진은 마이크로초 수준의 결정적 지연으로 명시적 리스크를 차단하고, Qwen3Guard는 119개 언어를 커버하며 암묵적 의미 리스크를 식별하며, 전 사이트 강제 심사로 규정 위반 콘텐츠, 프롬프트 인젝션, 모델 탈옥이 가져오는 보안 리스크를 근원에서 낮춘다.

55873은 기술 문서에서 공개 테스트 데이터를 인용하고, Qwen3Guard의 다단계 궤적 리스크 탐지에서의 정량적 경계를 솔직하게 공개하며, 세 가지 보상 방안을 설계했다. 6+1+3 하이브리드 모델 체계, 5엔진 마이크로커널 아키텍처, 72시간 정리 + 영구 증거 보존 이중 전략과 함께, 이중 계층 보안 리스크 통제는 18개 1급 인터페이스와 7개 국어 생태계에 정량화 가능하고 감사 가능하며 재현 가능한 보안 보장을 제공한다.

👉 이것은 55873 생태계 기술 백서 제4편이며, 이후 더 많은 특집이 순차적으로 발표될 예정이다.

유익했다면 좋아요 + 즐겨찾기, 길을 잃지 마세요 👇

주제 태그: 이중 계층 보안 리스크 통제 Rust 보안 AI 보안 시스템 설계 아키텍처 실전 OWASP