에이전트형 강화 학습을 위한 단일 롤아웃 비동기 최적화
SAO는 단일 롤아웃 샘플링과 토큰 레벨 클리핑을 통해 에이전트형 강화 학습의 안정성과 효율성을 높인 기술이다.
기존 LLM을 위한 강화 학습(RL) 파이프라인은 주로 동기식(Synchronous) 및 배치 인터리브(Batch-interleaved) 방식으로 작동하여, 긴 호흡의 작업을 수행하는 **에이전트형 작업(Agentic tasks)**에는 비효율적이었다. 최근 대안으로 떠오른 비동기식 RL은 모델 업데이트 속도는 빠르지만, 학습 안정성과 작업 효과 측면에서 한계가 있었다.
본 논문은 이러한 문제를 해결하기 위해 **SAO(Single-rollout Asynchronous Optimization)**를 제안한다. SAO는 기존 GRPO 프레임워크의 그룹 단위 샘플링 방식이 비동기 학습에 적합하지 않다는 점에 착안하여, 프롬프트당 하나의 롤아웃만 사용하는 단일 롤아웃 샘플링(Single-rollout sampling) 방식을 도입했다. 이를 통해 오프-폴리시(Off-policy) 효과를 줄이고 일반화 성능을 개선했다.
또한 최적화 안정성을 확보하기 위해 다음과 같은 기술적 장치를 포함한다:
- 엄격한 양방향 토큰 레벨 클리핑(Strict double-side token-level clipping) 전략 도입
- 실용적인 가치 모델(Value-model) 학습 설계 적용
실험 결과, SAO는 SWE-Bench Verified, BeyondAIME, IMOAnswerBench와 같은 에이전트 코딩 및 추론 벤치마크에서 GRPO 및 그 변형 모델들을 일관되게 능가했다. 특히 변화하는 환경에 적응해야 하는 온라인 학습 환경에서도 뛰어난 성능을 보였으며, 실제 GLM-5.2(750B-A40B) 모델의 에이전트 RL 파이프라인에 성공적으로 배포되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.