AI Briefing

에이전트 RL을 위한 SAO 최적화 기술 공개

[2607.07508] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

·2026.07.14 21:49

비동기 강화 학습의 안정성과 효율성을 높여 에이전트 학습 성능을 개선한 SAO 방법론을 제안한다.

기존의 LLM 강화 학습(RL) 파이프라인은 주로 동기식(Synchronous) 방식으로 작동하여, 긴 호흡의 작업이 필요한 에이전트 기반 태스크에서는 효율성이 떨어지는 문제가 있었습니다.

본 논문에서 제안하는 **SAO(Single-rollout Asynchronous Optimization)**는 다음과 같은 핵심 기술을 통해 비동기 RL의 안정성과 효율성을 해결합니다.

  • Single-rollout Sampling: 기존 GRPO의 그룹 단위 샘플링 대신, 프롬프트당 하나의 롤아웃을 사용하는 방식을 채택하여 오프-폴리시(Off-policy) 효과를 줄이고 일반화 성능을 높였습니다.
  • Double-side Token-level Clipping: 최적화 과정의 안정성을 확보하기 위해 엄격한 토큰 단위 클리핑 전략을 도입했습니다.
  • 성능 검증: SWE-Bench Verified, BeyondAIME 등 에이전트 코딩 및 추론 벤치마크에서 기존 GRPO 및 변형 모델보다 일관되게 높은 성능을 기록했습니다.

특히 SAO는 GLM-5.2(750B-A40B) 모델의 에이전트 RL 파이프라인에 성공적으로 적용되어 실질적인 효과를 입증했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.