AI Briefing

MSRA, 3500줄 코드 Agent Lightning v1.0 공개… Qwen3.5-9B 성능 14.6%p 향상

·2026.10.08 01:00

핵심 내용

MSRA, Agent Lightning v1.0 공개… Qwen3.5-9B 성능 14.6%p 향상

1 / 6

자세히 보기

마이크로소프트 리서치 아시아(Microsoft Research Asia)가 배포용 에이전트 하네스가 강화 학습에 직접 참여하는 'Harnessed Agentic RL' 학습 패러다임을 공개했다. 이 방식은 학습 프레임워크 내에서 에이전트를 재구현할 필요가 없다. 연구진은 이 패러다임 기반의 경량 제어 평면인 Agent Lightning v1.0을 오픈소스로 공개했으며, 기존 코드를 수정하지 않고 실제 에이전트 시스템과 통합할 수 있도록 설계됐다.

경량 아키텍처 및 Kubernetes 지원

Agent Lightning v1.0은 약 3,500줄의 코드로 구현되어 단순성과 재현성을 강조한다. 시스템은 모델 호출을 기록하는 OpenAI 호환 LLM 프록시 역할을 하는 API Gateway, 에이전트 실행을 관리하는 Rollout Controller, 그리고 verl 기반의 Customized Trainer 등 세 가지 핵심 구성 요소로 이루어진다.

이 프레임워크는 Kubernetes를 네이티브로 지원하여 에이전트를 자체 관리 클러스터, 클라우드 인프라, 또는 로컬 머신에서 표준 Kubernetes 작업으로 실행할 수 있게 한다. 이를 통해 유료 상용 샌드박스 서비스에 대한 의존성을 없애고 대규모 롤아웃 시 비용을 절감하며 자원 효율성을 높인다.

성능 및 학습 효율

연구팀은 롤아웃과 모델 업데이트가 동일한 GPU 자원을 공유할 수 있게 하는 Collocated Async RL 방식을 도입했다. 이 기법은 동기식 RL 대비 약 2배의 엔드투엔드 속도 향상을 달성했으며, 기존 비동기 방식보다 적은 수의 GPU를 사용한다.

실제 시연에서 연구진은 Qwen3.5-9B와 mini-SWE-agent를 사용하여 엔드투엔드 코딩 에이전트 파이프라인을 구축했다. SWE-smith 데이터셋에서 약 6,000개의 학습 샘플만 사용했을 때, RL 학습을 통해 모델의 SWE-bench Verified 기준 Pass@1 점수가 **41.8%**에서 **56.4%**로 상승했으며, 이는 절대 14.6%p의 향상이다. 또한 롤아웃 단위 이점 계산과 손실 정규화가 샘플 단위 처리보다 더 안정적인 학습을 제공함을 실험으로 검증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.