AI Briefing

vLLM V0에서 V1로: RL에서 보정보다 정확성 먼저

·2026.05.07 06:00

핵심 내용

vLLM V1의 logprob·캐시·업데이트 차이를 고쳐 V0 궤적에 맞췄다.

1 / 2

자세히 보기

vLLM V1로 옮긴 GSPO RL에서 rollout logprob와 런타임 동작이 V0와 달라져 clip rate, KL, entropy, reward가 흔들렸다.

핵심 수정은 네 가지였다.

  • processed_logprobs를 켜서 sampler가 쓰는 처리된 분포 기준으로 logprob를 맞췄다.
  • enable-prefix-caching=false, async-scheduling=false를 명시해 V1 기본값 차이를 제거했다.
  • pause_generation(mode="keep", clear_cache=False)로 inflight weight update 동작을 V0에 가깝게 맞췄다.
  • fp32 lm_head를 적용하자 최종 projection 경로가 맞아들며 reward가 V0 참조 곡선에 근접했다.

processed_logprobs만으로는 mismatch가 남았고, batch invariance 테스트에서도 lag와 clip rate 문제가 계속됐다. 같은 종류의 문제는 PPO, GRPO 같은 온라인 RL에도 나타날 수 있다. 결론은 RL 보정부터 얹기보다, rollout backend가 trainer의 가정을 먼저 만족하는지 확인해야 한다는 것이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.