Qwen3Guard: 토큰 스트림을 위한 실시간 안전성
핵심 내용
Qwen3Guard는 prompt와 response를 실시간으로 판별하는 안전 가드레일이다.
자세히 보기
Qwen3Guard는 Qwen family의 첫 safety guardrail model로, Qwen3 foundation model을 안전 분류용으로 fine-tune해 prompt와 response의 위험도를 정밀하게 판별한다. English, Chinese, multilingual 환경에서 모두 강한 성능을 보이며, prompt classification과 response classification을 함께 지원한다.
두 가지 변형이 제공된다.
- Qwen3Guard-Gen: 전체 user prompt와 model response를 입력받아 안전성을 분류하는 generative model이다. 오프라인 safety annotation, dataset filtering, safety-based reward for RL에 적합하다.
- Qwen3Guard-Stream: response 생성 중 token-by-token으로 안전성을 평가하는 streaming 모델이다. 두 개의 lightweight classification head를 final layer에 붙여, 생성과 동시에 저지연 moderation을 수행한다.
분류 체계는 Safe / Unsafe / Controversial의 3단계다. 단순한 이진 분류보다 유연해서, application에 따라 Controversial을 Safe 또는 Unsafe로 재해석할 수 있으며, 서로 다른 데이터셋 기준에도 더 안정적으로 대응한다.
지원 범위도 넓다. 119 languages and dialects를 커버하며, prompt와 response 모두에서 일관된 safety performance를 목표로 한다. 제공 크기는 0.6B, 4B, 8B로, 배포 환경과 자원 제약에 맞춰 선택할 수 있다.
활용 방식은 두 갈래다.
- Qwen3Guard-Gen으로 dataset moderation, offline labeling, RL safety signal 생성
- Qwen3Guard-Stream으로 LLM 응답 생성 중 실시간 개입과 안전 차단
모델은 Hugging Face, ModelScope에서 공개되며, Alibaba Cloud AI Guardrails 서비스에도 Qwen3Guard 기술이 적용된다. 안전한 AI 상호작용을 위해, 학습 단계와 추론 단계 모두에서 더 유연한 moderation을 제공하는 것이 핵심이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.