AI Briefing

Rule-Based Rewards를 통한 모델의 안전 행동 개선

·2024.07.24 18:00

OpenAI는 인간의 피드백 없이도 모델의 안전성을 효율적으로 개선할 수 있는 Rule-Based Rewards(RBR) 방식을 도입했다.

기존의 RLHF(Reinforcement Learning from Human Feedback) 방식은 모델의 지시 이행 능력을 높이는 데 핵심적이지만, 반복적인 작업에 대한 인간의 피드백 수집이 비효율적이며 안전 정책 변경 시 대응이 어렵다는 한계가 있다.

OpenAI는 이를 해결하기 위해 **Rule-Based Rewards(RBRs)**를 도입했다. RBR은 명확하고 단계적인 규칙을 사용하여 모델의 출력이 안전 표준을 준수하는지 평가한다. 이를 통해 모델의 유용성을 유지하면서도 유해성을 방지하는 균형을 맞추며, 인간의 반복적인 개입 없이도 효율적인 학습이 가능하다.

RBR은 다음과 같은 과정을 통해 작동한다:

  • 명제(Propositions) 정의: '판단적 태도', '허용되지 않는 콘텐츠 포함' 등 응답의 특정 측면에 대한 단순한 문장을 정의한다.
  • 규칙(Rules) 생성: 정의된 명제를 조합하여 다양한 시나리오에서 안전하고 적절한 응답을 포착할 수 있는 정교한 규칙을 만든다.
  • 그레이더(Grader) 활용: 고정된 언어 모델인 그레이더가 규칙에 따라 응답을 점수화하며, 이를 통해 새로운 규칙이나 안전 정책에 유연하게 대응한다.

이 기술은 이미 GPT-4GPT-4o mini에 적용되어 있으며, 향후 출시될 모델에도 지속적으로 구현될 예정이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.