gpt-oss-safeguard 기술 보고서
·2025.10.29 09:00
핵심 내용
OpenAI가 정책 기반 콘텐츠 분류를 위해 설계된 오픈 웨이트 추론 모델 gpt-oss-safeguard를 공개했다.
자세히 보기
gpt-oss-safeguard-120b와 gpt-oss-safeguard-20b는 gpt-oss 모델을 기반으로 사후 학습된 오픈 웨이트 추론 모델이다. 이 모델들은 사용자가 제공한 특정 정책에 따라 콘텐츠를 분류하도록 설계되었다.
Apache 2.0 라이선스로 제공되는 이 모델들은 다음과 같은 주요 특징을 갖춘다:
- Responses API와 호환되는 텍스트 전용 모델
- 전체 Chain-of-Thought(CoT) 제공 및 커스터마이징 가능
- 다양한 추론 강도(low, medium, high) 지원 및 Structured Outputs 지원
OpenAI는 이 모델들을 일반적인 사용자 상호작용을 위한 핵심 기능보다는, 정책에 따른 콘텐츠 분류 용도로 사용할 것을 권장한다. 또한, 챗 설정에서의 안전성 및 다국어 성능에 대한 초기 평가 결과를 통해 모델의 역량을 검증했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.