gpt-oss-safeguard 공개
·2025.10.29 09:00
OpenAI가 개발자의 맞춤형 안전 정책을 추론으로 해석하는 오픈 웨이트 모델 gpt-oss-safeguard를 공개했다.
OpenAI가 안전 분류 작업을 위한 오픈 웨이트 추론 모델인 gpt-oss-safeguard의 리서치 프리뷰를 공개했다. 모델은 gpt-oss-safeguard-120b와 20b 두 가지 크기로 제공되며, Apache 2.0 라이선스에 따라 자유롭게 사용 및 수정이 가능하다.
이 모델은 추론(Reasoning)을 통해 개발자가 제공한 정책을 추론 시점에 직접 해석한다. Chain-of-Thought(CoT) 방식을 사용하여 모델이 결론에 도달하는 과정을 보여주므로, 개발자는 모델의 판단 근거를 검토할 수 있다.
기존의 전통적인 안전 분류기(예: Moderation API)는 수천 개의 사례를 학습하여 정책을 간접적으로 추론하지만, gpt-oss-safeguard는 정책 자체를 입력으로 받는다. 이를 통해 다음과 같은 상황에서 특히 유용하다:
- 새로운 유형의 위해 요소가 등장하여 정책을 빠르게 변경해야 할 때
- 도메인이 매우 미묘하여 소규모 분류기로 처리하기 어려울 때
- 특정 위험에 대해 고품질 분류기를 학습시킬 충분한 샘플이 없을 때
- 지연 시간보다 설명 가능한 고품질 라벨링이 더 중요할 때
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.