단호한 거절에서 안전한 완성으로: 출력 중심의 안전 학습을 향하여
·2025.08.07 09:00
GPT-5는 출력물 안전성에 집중하는 'safe-completion' 학습을 통해 이중 용도 질문에 대해 안전성과 유용성을 동시에 확보한다.
기존 ChatGPT와 같은 모델은 사용자의 질문에 따라 답변 여부를 결정하는 refusal-based safety training을 사용해 왔다. 하지만 폭죽 제조법처럼 의도가 불분명한 dual-use(이중 용도) 질문의 경우, 모델은 위험을 감수하고 답변하거나 아예 도움을 거절하는 이분법적 선택을 해야 하는 한계가 있었다.
GPT-5는 이를 해결하기 위해 safe-completion이라는 새로운 안전 학습 방식을 도입했다. 이 방식은 사용자의 입력(input)에 따른 거절 경계를 정하는 대신, 모델의 출력(output)이 안전한지에 집중한다.
safe-completion은 다음과 같은 두 가지 파라미터를 통해 구현된다:
- Safety constraint: 안전 정책을 위반하는 응답에 대해 페널티를 부여한다.
- Helpfulness maximization: 안전 경계를 유지하면서도 가능한 한 가장 유용한 답변을 제공하도록 학습한다.
실제 사례로 폭죽 점화 관련 질문을 던졌을 때, 거절 학습 기반의 OpenAI o3는 질문을 무해하다고 판단해 위험한 상세 정보를 모두 제공했다. 반면, GPT-5는 구체적인 위험 정보 제공은 거절하되, 관련 법규 준수나 전문가 상담 등 안전한 가이드를 제공하며 안전성과 유용성 사이의 균형을 맞췄다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.