AI Briefing

에이전트형 강화 학습을 위한 단일 롤아웃 비동기 최적화

·2026.07.10 09:00

SAO는 단일 롤아웃 샘플링과 토큰 레벨 클리핑을 통해 에이전트형 강화 학습의 안정성과 효율성을 높인 기술이다.

기존 LLM을 위한 강화 학습(RL) 파이프라인은 주로 동기식(Synchronous) 및 배치 인터리브(Batch-interleaved) 방식으로 작동하여, 긴 호흡의 작업을 수행하는 **에이전트형 작업(Agentic tasks)**에는 비효율적이었다. 최근 대안으로 떠오른 비동기식 RL은 모델 업데이트 속도는 빠르지만, 학습 안정성과 작업 효과 측면에서 한계가 있었다.

본 논문은 이러한 문제를 해결하기 위해 **SAO(Single-rollout Asynchronous Optimization)**를 제안한다. SAO는 기존 GRPO 프레임워크의 그룹 단위 샘플링 방식이 비동기 학습에 적합하지 않다는 점에 착안하여, 프롬프트당 하나의 롤아웃만 사용하는 단일 롤아웃 샘플링(Single-rollout sampling) 방식을 도입했다. 이를 통해 오프-폴리시(Off-policy) 효과를 줄이고 일반화 성능을 개선했다.

또한 최적화 안정성을 확보하기 위해 다음과 같은 기술적 장치를 포함한다:

  • 엄격한 양방향 토큰 레벨 클리핑(Strict double-side token-level clipping) 전략 도입
  • 실용적인 가치 모델(Value-model) 학습 설계 적용

실험 결과, SAO는 SWE-Bench Verified, BeyondAIME, IMOAnswerBench와 같은 에이전트 코딩 및 추론 벤치마크에서 GRPO 및 그 변형 모델들을 일관되게 능가했다. 특히 변화하는 환경에 적응해야 하는 온라인 학습 환경에서도 뛰어난 성능을 보였으며, 실제 GLM-5.2(750B-A40B) 모델의 에이전트 RL 파이프라인에 성공적으로 배포되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.