AI Briefing

SAPO: 대규모 언어 모델 학습을 위한 안정적이고 고성능인 강화학습 방법

·2025.12.05 05:00

핵심 내용

SAPO는 hard clipping 대신 smooth gating으로 LLM 강화학습을 안정화한다.

자세히 보기

**SAPO(Soft Adaptive Policy Optimization)**는 대규모 언어 모델 강화학습에서 token-level importance ratio 변동이 큰 문제를 줄이기 위한 정책 최적화 방법이다. 특히 Mixture-of-Experts(MoE) 모델이나 긴 autoregressive 출력에서 정책 업데이트가 noisy해지는 상황을 겨냥한다.

기존 GRPO와 GSPO는 importance ratio가 일정 범위를 벗어나면 gradient를 잘라내는 hard clipping을 사용한다. 이 방식은 급격한 업데이트는 막지만, 유용한 학습 신호까지 버리거나 몇 개의 off-policy token 때문에 전체 sequence가 무시되는 문제가 생긴다.

SAPO는 hard clipping을 temperature-controlled smooth gating function으로 대체한다. 정책이 behavior policy에서 멀어진 token은 부드럽게 down-weight하고, 여전히 유용한 gradient는 보존한다. 이 설계는 sequence-level coherence를 유지하면서도 token-level adaptivity를 제공한다.

핵심 차이는 다음과 같다:

  • continuous trust region으로 clipping의 불연속성을 줄인다.
  • sequence-level 안정성은 GSPO처럼 유지하되 전체 sequence를 쉽게 버리지 않는다.
  • token-level adaptivity로 문제가 되는 token만 선택적으로 억제한다.
  • positive/negative advantage에 서로 다른 temperature를 쓰는 asymmetric temperature design을 적용한다.

Qwen 팀은 SAPO가 안정성, sample efficiency, 학습 진행의 일관성 사이에서 더 나은 균형을 제공한다고 설명한다. 결론적으로 SAPO는 LLM reasoning, coding, multimodal reasoning을 강화하는 RL 파이프라인에서 더 안정적인 policy optimization을 목표로 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.