vLLM V0에서 V1로: RL에서 보정보다 정확성 먼저
·2026.05.07 06:00
핵심 내용
vLLM V1의 logprob·캐시·업데이트 차이를 고쳐 V0 궤적에 맞췄다.
1 / 2
자세히 보기
vLLM V1로 옮긴 GSPO RL에서 rollout logprob와 런타임 동작이 V0와 달라져 clip rate, KL, entropy, reward가 흔들렸다.
핵심 수정은 네 가지였다.
- processed_logprobs를 켜서 sampler가 쓰는 처리된 분포 기준으로 logprob를 맞췄다.
enable-prefix-caching=false,async-scheduling=false를 명시해 V1 기본값 차이를 제거했다.pause_generation(mode="keep", clear_cache=False)로 inflight weight update 동작을 V0에 가깝게 맞췄다.- fp32 lm_head를 적용하자 최종 projection 경로가 맞아들며 reward가 V0 참조 곡선에 근접했다.
processed_logprobs만으로는 mismatch가 남았고, batch invariance 테스트에서도 lag와 clip rate 문제가 계속됐다. 같은 종류의 문제는 PPO, GRPO 같은 온라인 RL에도 나타날 수 있다. 결론은 RL 보정부터 얹기보다, rollout backend가 trainer의 가정을 먼저 만족하는지 확인해야 한다는 것이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.