gpt-oss-safeguard 기술 보고서
·2025.10.29 09:00
OpenAI가 정책 기반 콘텐츠 분류를 위해 설계된 오픈 웨이트 추론 모델 gpt-oss-safeguard를 공개했다.
gpt-oss-safeguard-120b와 gpt-oss-safeguard-20b는 gpt-oss 모델을 기반으로 사후 학습된 오픈 웨이트 추론 모델이다. 이 모델들은 사용자가 제공한 특정 정책에 따라 콘텐츠를 분류하도록 설계되었다.
Apache 2.0 라이선스로 제공되는 이 모델들은 다음과 같은 주요 특징을 갖춘다:
- Responses API와 호환되는 텍스트 전용 모델
- 전체 Chain-of-Thought(CoT) 제공 및 커스터마이징 가능
- 다양한 추론 강도(low, medium, high) 지원 및 Structured Outputs 지원
OpenAI는 이 모델들을 일반적인 사용자 상호작용을 위한 핵심 기능보다는, 정책에 따른 콘텐츠 분류 용도로 사용할 것을 권장한다. 또한, 챗 설정에서의 안전성 및 다국어 성능에 대한 초기 평가 결과를 통해 모델의 역량을 검증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.