언어 모델의 확장 가능한 강화학습을 위한 GSPO
핵심 내용
GSPO는 sequence-level 최적화로 GRPO의 불안정성을 줄이고 RL 확장을 가능하게 한다.
자세히 보기
**GSPO(Group Sequence Policy Optimization)**는 언어 모델 강화학습(RL)을 더 크고 안정적으로 확장하기 위한 새로운 알고리즘이다. 기존 GRPO는 장시간 학습에서 불안정해지며, 되돌리기 어려운 모델 붕괴까지 일으킬 수 있어 compute를 더 써도 성능이 계속 오르지 않는 문제가 있었다.
GSPO의 핵심은 importance ratio를 token-level이 아니라 sequence likelihood로 정의하고, 그 기준으로 sequence-level clipping, rewarding, optimization을 수행하는 것이다. 또한 길이 정규화(length normalization)를 적용해 분산을 줄이고 수치 범위를 안정화한다.
저자들은 GSPO가 다음 세 가지 면에서 GRPO보다 뛰어나다고 설명한다.
- Performant and Efficient: 같은 학습 비용에서 더 높은 성능을 내며, compute를 늘리면 성능이 계속 개선된다.
- Notably Stable: 장기 학습에서도 안정적이며, 특히 MoE 모델의 RL 학습 안정성 문제를 해결한다.
- Infrastructure-Friendly: sequence-level 최적화 덕분에 precision 차이에 더 관대해, 인프라를 단순화할 가능성이 크다.
실험은 Qwen3-30B-A3B-Base에서 cold-start 모델을 fine-tune해 진행됐고, AIME'24, LiveCodeBench, CodeForces에서의 성능 곡선과 training reward 곡선을 GRPO와 비교했다. 결과적으로 GSPO는 더 높은 training efficiency를 보였고, compute를 늘리고 query set을 갱신하고 generation length를 늘릴수록 성능이 계속 올라가는, 진짜 의미의 scalability를 보여줬다.
특히 GSPO에서는 clipped token 비율이 GRPO보다 두 자릿수 배 이상 높았는데도 더 좋은 학습 효율을 달성했다. 이는 token-level 목표가 noisy하고 비효율적인 반면, sequence-level 접근이 더 신뢰할 수 있는 학습 신호를 준다는 점을 뒷받침한다.
MoE RL 측면에서도 변화가 크다. GRPO에서는 expert activation volatility 때문에 학습이 수렴하지 않아 Routing Replay가 필요했지만, 이 방식은 추가 메모리와 통신 비용을 유발했다. GSPO는 sequence-level likelihood만 보므로 Routing Replay를 완전히 제거할 수 있고, 그 결과 학습이 더 단순해지고 안정적이며 MoE의 용량도 더 온전히 활용할 수 있다.
또한 GSPO는 token-level likelihood보다 precision discrepancy에 덜 민감해, inference engine이 반환한 likelihood를 그대로 최적화에 활용할 수 있는 가능성도 제시한다. 이는 partial rollout, multi-turn RL, training-inference disaggregated frameworks 같은 환경에서 특히 유리하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.