AI Briefing

분포 관점에서 본 SFT·RL·On-Policy Distillation

·2026.05.11 09:00

저자는 SFT, RL, OPD를 분포 관점에서 비교하며 정책 기반 샘플링의 중요성을 강조했다.

언어 모델을 시퀀스 분포로 보면, 포스트트레이닝은 그 분포를 새 목표에 맞게 재배치하는 과정이다. 핵심은 어떤 target distribution을 얼마나 직접적으로 정의하느냐다.

SFT는 고정된 외부 데이터 분포를 향해 모델을 직접 끌어간다. cross-entropy는 사실상 forward KL 최소화에 가깝고, 시작 모델보다 데이터가 제시한 토큰이 더 중요하다. 그래서 형식 전환이나 cold-start에는 강하지만, 원래 분포와 멀어질수록 catastrophic forgetting이 쉽게 생긴다.

RL은 모델이 스스로 뽑은 rollout을 보상으로 평가받아 기대 보상을 키우는 방향으로 움직인다. 이때 기준은 외부 정답 분포가 아니라 현재 정책이며, 보상이 검증 가능한 RLVR에서는 이 방향이 비교적 선명하다. 그래서 explicit KL penalty를 약하게 두거나 PPO 대신 GRPO처럼 trust-region 제약을 완화하기도 한다.

**On-Policy Distillation (OPD)**은 SFT와 RL의 중간에 있다. 학생은 on-policy로 샘플을 만들지만, 업데이트는 교사 분포를 맞추는 reverse KL로 이뤄진다. 변형인 OPSD에서는 교사와 학생이 같은 모델이되 교사에게 reference solution prefix를 주고, per-token KL 분석에서 wait, alright 같은 스타일 토큰이 power, exponent, logarithm 같은 수학 토큰보다 더 큰 값을 보였다. 그래서 과도한 업데이트를 막는 per-token clipping이 필요했다. 이런 신호 때문에 OPSD는 RLHF보다 RLVR에 더 가까운 성격을 띤다.

Minimal Code Editing 실험에서는 buggy corrupted function을 주고 bug만 고치게 했다. 한 corruption 세트로 학습한 뒤 다른 corruption 유형으로 평가해 generalization을 봤고, 일반 코드 생성 능력은 LiveCodeBench v6로 확인했다. RL 교사는 자기 학습에서 더 높은 최종 reward를 얻고 더 잘 일반화했지만, OPD 학생은 교사가 누구든 거의 비슷하게 나왔다. SFT 교사가 이미 일반 코드 생성에서 망각을 보였더라도, OPD 학생은 그 손실을 크게 물려받지 않았다.

  • Teacher: SFT Pass@1 0.775, Norm. Levenshtein 0.450, Added CC 0.450, LiveCodeBench v6 0.286
  • Teacher: RL Pass@1 0.792, Norm. Levenshtein 0.063, Added CC 0.206, LiveCodeBench v6 0.320
  • OPD student: SFT teacher 0.800 / 0.059 / 0.206 / 0.297
  • OPD student: RL teacher 0.787 / 0.055 / 0.228 / 0.314

이 결과는 teacher 분포보다 on-policy sampling 자체가 더 중요할 수 있음을 시사한다. 저자는 RL이 덜 잊는 이유를 forward KL vs reverse KL만으로 설명하는 관점은 불충분하다고 보고, 다음 두 가지를 더 설득력 있게 본다.

  • Data-dependent regularization: SFT는 모든 토큰에 균일한 압력을 주지만, RL은 그룹 내 reward variance가 큰 경우 update를 상대적으로 줄인다.
  • Sparse parameter updates: RL은 작은 subnetwork를 주로 건드리는 sparse full-rank updates를 만들고, 업데이트 파라미터를 줄이면 SFT보다 더 빨리 성능이 무너져 RL 업데이트가 더 핵심적임을 보여준다.

한편 RLVR의 outcome reward는 episode당 O(1) bits만 주는 한계가 있고, OPD는 토큰마다 고유한 신호를 주지만 그만큼 noise와 bias가 커진다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.