AI Briefing

Deliberative alignment: 추론을 통한 더 안전한 언어 모델 구현

·2024.12.20 19:00

OpenAI가 모델이 안전 규정을 직접 추론하여 준수하도록 돕는 Deliberative alignment 기술을 공개했다.

OpenAI의 o-series 모델을 위한 새로운 정렬 전략인 Deliberative alignment가 도입되었다. 이 방식은 모델에게 인간이 작성한 해석 가능한 안전 규정의 텍스트를 직접 가르치고, 답변하기 전에 해당 규정에 대해 명시적으로 추론하도록 훈련하는 패러다임이다.

기존의 RLHF(인간 피드백 기반 강화 학습)나 Constitutional AI 방식은 안전 규정을 단순히 학습 레이블을 생성하는 용도로만 사용했다. 반면, Deliberative alignment는 모델이 **Chain-of-Thought(CoT)**를 통해 사용자 프롬프트를 검토하고, 내부 정책을 식별하며, 더 안전한 답변을 작성하도록 유도한다.

이 방식은 다음과 같은 핵심적인 성과를 보여준다:

  • 정밀한 정책 준수: OpenAI의 안전 정책을 매우 정밀하게 준수한다.
  • 효율적인 학습: 인간이 직접 레이블링한 CoT나 답변 데이터 없이도 학습이 가능하다.
  • 압도적인 성능: o1 모델은 다양한 안전 벤치마크에서 GPT-4o를 포함한 기존 최신 LLM들을 크게 앞선다.

결과적으로 이는 모델의 추론 능력 향상이 안전성 개선으로 이어질 수 있음을 입증하는 사례다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.