AI Briefing

[NeurIPS 2023] RLHF, RLAIF 연구 트렌드와 주요 논문 소개

·2026.07.16 09:00

NeurIPS 2023에서 발표된 RLHF 및 RLAIF의 최신 연구 동향과 주요 논문을 소개한다.

최근 LLM의 성능 향상을 위해 사람이나 AI의 피드백을 활용한 강화 학습 방법론이 주목받고 있다. 기존 **RLHF(Reinforcement Learning from Human Feedback)**는 보상 모델(Reward Model) 학습과 정책(Policy) 학습이라는 두 단계의 분리된 과정을 거치며, 이 과정에서 학습이 불안정해지거나 성능 개선이 어려운 한계가 있다.

이번 NeurIPS 2023에서는 이러한 문제를 해결하기 위한 두 가지 핵심 연구가 주목받았다.

  1. DPO (Direct Preference Optimization): 스탠퍼드 대학교에서 제안한 방법론으로, 보상 모델을 별도로 학습하지 않고 선호 데이터로부터 직접 정책을 학습한다. 기존 RLHF의 복잡한 과정을 단일 최적화 문제로 변형하여 더 높은 성능과 안정적인 학습 양상을 보여준다.

  2. Fine-Grained Human Feedback: 워싱턴 대학교에서 제안한 방법론으로, 단순한 선호도 정보 대신 명확한 기준(Metric)을 정의한 세밀한 피드백을 활용한다. 이를 통해 다양한 지표에 대해 보다 효과적인 학습이 가능하며, Detoxification 및 Long-Form QA 태스크에서 기존 방식보다 우수한 성능을 입증했다.

앞으로는 이처럼 구체적인 피드백 시그널을 활용하여 다양한 사용자 선호도에 최적화된 LLM을 구현하는 연구가 더욱 가속화될 전망이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.