AI Briefing

gpt-oss-safeguard 공개

·2025.10.29 09:00

핵심 내용

OpenAI가 개발자의 맞춤형 안전 정책을 추론으로 해석하는 오픈 웨이트 모델 gpt-oss-safeguard를 공개했다.

자세히 보기

OpenAI가 안전 분류 작업을 위한 오픈 웨이트 추론 모델인 gpt-oss-safeguard의 리서치 프리뷰를 공개했다. 모델은 gpt-oss-safeguard-120b와 20b 두 가지 크기로 제공되며, Apache 2.0 라이선스에 따라 자유롭게 사용 및 수정이 가능하다.

이 모델은 추론(Reasoning)을 통해 개발자가 제공한 정책을 추론 시점에 직접 해석한다. Chain-of-Thought(CoT) 방식을 사용하여 모델이 결론에 도달하는 과정을 보여주므로, 개발자는 모델의 판단 근거를 검토할 수 있다.

기존의 전통적인 안전 분류기(예: Moderation API)는 수천 개의 사례를 학습하여 정책을 간접적으로 추론하지만, gpt-oss-safeguard는 정책 자체를 입력으로 받는다. 이를 통해 다음과 같은 상황에서 특히 유용하다:

  • 새로운 유형의 위해 요소가 등장하여 정책을 빠르게 변경해야 할 때
  • 도메인이 매우 미묘하여 소규모 분류기로 처리하기 어려울 때
  • 특정 위험에 대해 고품질 분류기를 학습시킬 충분한 샘플이 없을 때
  • 지연 시간보다 설명 가능한 고품질 라벨링이 더 중요할 때

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.