AI Briefing

Qwen3Guard: 토큰 스트림을 위한 실시간 안전성

·2025.09.23 05:00

핵심 내용

Qwen3Guard는 prompt와 response를 실시간으로 판별하는 안전 가드레일이다.

1 / 2

자세히 보기

Qwen3Guard는 Qwen family의 첫 safety guardrail model로, Qwen3 foundation model을 안전 분류용으로 fine-tune해 prompt와 response의 위험도를 정밀하게 판별한다. English, Chinese, multilingual 환경에서 모두 강한 성능을 보이며, prompt classification과 response classification을 함께 지원한다.

두 가지 변형이 제공된다.

  • Qwen3Guard-Gen: 전체 user prompt와 model response를 입력받아 안전성을 분류하는 generative model이다. 오프라인 safety annotation, dataset filtering, safety-based reward for RL에 적합하다.
  • Qwen3Guard-Stream: response 생성 중 token-by-token으로 안전성을 평가하는 streaming 모델이다. 두 개의 lightweight classification head를 final layer에 붙여, 생성과 동시에 저지연 moderation을 수행한다.

분류 체계는 Safe / Unsafe / Controversial의 3단계다. 단순한 이진 분류보다 유연해서, application에 따라 Controversial을 Safe 또는 Unsafe로 재해석할 수 있으며, 서로 다른 데이터셋 기준에도 더 안정적으로 대응한다.

지원 범위도 넓다. 119 languages and dialects를 커버하며, prompt와 response 모두에서 일관된 safety performance를 목표로 한다. 제공 크기는 0.6B, 4B, 8B로, 배포 환경과 자원 제약에 맞춰 선택할 수 있다.

활용 방식은 두 갈래다.

  • Qwen3Guard-Gen으로 dataset moderation, offline labeling, RL safety signal 생성
  • Qwen3Guard-Stream으로 LLM 응답 생성 중 실시간 개입과 안전 차단

모델은 Hugging Face, ModelScope에서 공개되며, Alibaba Cloud AI Guardrails 서비스에도 Qwen3Guard 기술이 적용된다. 안전한 AI 상호작용을 위해, 학습 단계와 추론 단계 모두에서 더 유연한 moderation을 제공하는 것이 핵심이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.