AI Briefing

Agent Lightning v1.0: Harnessed Agentic RL로 나아가다

·2026.08.20 09:00

핵심 내용

Agent Lightning v1.0이 에이전트 하네스를 활용한 RL 학습 프레임워크로 공개됐다.

자세히 보기

현대 AI 에이전트는 도구, 컨텍스트, 제어 흐름을 관리하는 에이전트 하네스(Agent Harness) 내부에서 동작하며, 이는 에이전트 시스템의 핵심 구성 요소가 되었다. 기존 Agent Lightning은 LLM 엔드포인트 프록시를 통해 임의의 에이전트를 RL 학습에 연결하는 분산 아키텍처를 도입했으며, 이 방식은 Harnessed Agentic RL이라는 새로운 패러다임으로 발전했다.

Harnessed Agentic RL은 전통적인 에이전트 RL과 근본적으로 다르다. 환경 상호작용 루프를 학습 엔진이 아닌 배포 시점의 하네스가 소유하며, 트레이너는 LLM 요청-응답 쌍의 시퀀스만 관찰한다. 이로 인해 리토큰화, 샘플 병합, 어드밴티지 계산, 손실 정규화, 백엔드 스케줄링 등 학습 안정성과 효과에 영향을 미치는 새로운 기술적 과제가 발생한다.

Agent Lightning v1.0은 약 3,500줄의 코드로 구현된 경량 프레임워크로, 이러한 과제들을 연구하기 위한 실용적인 테스트베드 역할을 한다. 임의의 에이전트 하네스를 지원하며, 지시 준수, 검색, 코딩 에이전트에 대한 평가를 수행했다. 특히 코딩 에이전트 RL을 위한 완전한 재현 가능 파이프라인을 제공했으며, Qwen3.5-9B 모델을 SWE-bench Verified 벤치마크에서 41.8%에서 56.4%로 14.6%p(절대값) 향상시키는 성과를 거뒀다. 이는 6K 학습 예제와 modest한 컴퓨팅 리소스만으로 달성된 결과이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.