AI Briefing

On-Policy Distillation의 실체: 도움이 되는 경우와 해가 되는 경우, 그리고 그 이유

·2026.07.09 09:00

On-Policy Distillation이 추론 모델 학습에 미치는 영향을 토큰 단위로 분석하는 진단 프레임워크를 제안한다.

On-Policy Distillation은 추론 모델 학습을 위해 토큰 단위의 조밀한 감독 신호를 제공하지만, 어떤 조건에서 이 신호가 유익하거나 해로운지는 명확하지 않았다. 기존에는 이를 확인하기 위해 막대한 비용이 드는 학습 과정이 필요했으며, 전체 성능 지표만으로는 개별 토큰 수준의 역학을 파악하기 어려웠다.

본 연구에서는 토큰, 질문, 교사 모델(Teacher model)별로 작동하는 Training-free 진단 프레임워크를 도입한다. 학생 모델의 성공 확률을 최대화하는 파라미터 업데이트를 정의하여 Ideal per-node gradient를 도출하고, 이를 효율적으로 추정하기 위한 Scalable targeted-rollout 알고리즘을 개발했다.

분석 결과, Distillation 가이드는 학생 모델이 이미 정답을 맞힌 경우보다 **오답을 낸 경우(Incorrect rollouts)**에 훨씬 더 높은 Gradient alignment score를 보였다. 정답 상황에서는 교사의 신호가 오히려 노이즈로 작용할 수 있음을 시사한다.

또한, 최적의 Distillation 컨텍스트는 학생 모델의 용량과 대상 작업에 따라 공동으로 결정되며, 모든 상황에 적용 가능한 단일 설정은 존재하지 않는다. 따라서 Distillation 과정에서 작업 및 토큰별 진단 분석을 수행하는 것이 필수적이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.