AI Briefing

엔트로피 보존 강화학습

·2026.03.30 09:00

핵심 내용

정책경사 학습이 엔트로피를 깎는 문제를 제어해 탐색 다양성을 지킨다.

자세히 보기

정책경사 기반 학습은 언어모델 추론 성능을 끌어올렸지만, 학습이 진행될수록 엔트로피가 감소해 탐색 다양성이 줄어드는 경향이 있다. 그 결과 정책은 점점 더 제한된 궤적만 탐색하게 되고, 새로운 환경에서의 학습 가능성도 약해진다.

저자들은 엔트로피를 학습 과정 전반에서 모니터링하고 제어해야 한다고 주장한다. 이를 위해 주요 policy gradient 목적함수가 엔트로피 변화에 어떤 영향을 주는지 이론적으로 분석하고, 수치 정밀도 같은 실험적 요인이 엔트로피 거동에 큰 영향을 준다는 점도 짚는다.

해결책으로는 엔트로피를 조절하도록 advantage를 수정하는 REPO 계열 알고리즘과, 비대칭 클리핑을 적응적으로 적용하는 ADAPO를 제안한다. 이 방법들로 학습한 모델은 학습 내내 다양성을 더 잘 유지했고, 최종 성능도 더 좋았으며, 이후의 순차 학습에서도 더 잘 유지되는 정책을 보였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.