AI Briefing

gpt-oss-safeguard 기술 보고서

·2025.10.29 09:00

핵심 내용

OpenAI가 정책 기반 콘텐츠 분류를 위해 설계된 오픈 웨이트 추론 모델 gpt-oss-safeguard를 공개했다.

자세히 보기

gpt-oss-safeguard-120b와 gpt-oss-safeguard-20b는 gpt-oss 모델을 기반으로 사후 학습된 오픈 웨이트 추론 모델이다. 이 모델들은 사용자가 제공한 특정 정책에 따라 콘텐츠를 분류하도록 설계되었다.

Apache 2.0 라이선스로 제공되는 이 모델들은 다음과 같은 주요 특징을 갖춘다:

  • Responses API와 호환되는 텍스트 전용 모델
  • 전체 Chain-of-Thought(CoT) 제공 및 커스터마이징 가능
  • 다양한 추론 강도(low, medium, high) 지원 및 Structured Outputs 지원

OpenAI는 이 모델들을 일반적인 사용자 상호작용을 위한 핵심 기능보다는, 정책에 따른 콘텐츠 분류 용도로 사용할 것을 권장한다. 또한, 챗 설정에서의 안전성 및 다국어 성능에 대한 초기 평가 결과를 통해 모델의 역량을 검증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.