AI Briefing

Reward Model의 과도한 민감도 문제

·2026.06.29 09:00

Meta는 Reward Model이 유사한 응답에 과도하게 반응하여 발생하는 Reward Hacking 문제를 해결하기 위한 새로운 측정 및 클러스터링 방법을 제안했다.

Meta의 연구에 따르면 Reward Model이 품질이 동일한 응답들에 대해 서로 다른 점수를 부여하는 과도한 민감도 문제를 보일 수 있으며, 이는 강화 학습 과정에서 Reward Hacking을 유도하는 원인이 된다.

연구팀은 이를 해결하기 위해 모델의 Discriminative Ability(변별력)와 Specificity(특이성)를 함께 측정하는 프레임워크를 제안한다. 이를 통해 모델이 응답의 미세한 차이를 구분하는 능력과 불필요한 노이즈에 반응하는 정도를 정량화한다.

또한, Monte Carlo Dropout 기법을 활용하여 보상 값을 더 안전하고 안정적인 이산적 신호(Discrete signals)로 클러스터링하는 방식을 도입한다. 이러한 접근법은 학습 과정의 변동성을 줄이고 모델의 안정성을 높이는 데 기여한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.