Mercor·SkyRL, 397B 파라미터 지식 업무 에이전트 RL 훈련 가이드 공개
핵심 내용
Mercor와 SkyRL이 397B 파라미터 모델의 지식 업무 에이전트 RL 훈련 전 과정을 공개했다.
자세히 보기
Mercor와 SkyRL이 Qwen3.5-397B-A17B 모델의 지식 업무 에이전트(knowledge work agent) 강화학습(RL) 훈련 가이드를 공개했다. 이 가이드는 전체 훈련 스크립트, 모델 가중치, 평가 트레이스를 포함하며, APEX-Agents 벤치마크에서 Pass@1 점수를 16.11%에서 27.29%로 70% 향상시킨 성과를 재현한다.
훈련 인프라 및 리스크 제거
훈련의 핵심은 GPU 시간을 낭비하는 실패 궤적을 줄이고 정확한 토큰 회계 처리(TITO)를 보장하는 것이다. Harbor 프레임워크를 활용해 컨테이너화된 환경에서 에이전트를 실행하며, MCP 서버와 코드 실행 도구를 통해 수십 개의 파일과 서버가 포함된 시뮬레이션된 회사 환경에서 작업을 수행한다. 환경 오류를 최소화하기 위해 모든 상호작용에 타임아웃을 설정하고, LLM judge의 rate limit을 우회하는 전략 등을 적용했다.
알고리즘 최적화 및 영웅 실행(Hero Run)
35B 모델에서의 애블레이션을 통해 DPPO 손실 함수와 prompt_mean 집계 방식, 그리고 컨텍스트 예산이 20% 남았을 때 마무리를 유도하는 harness nudge가 가장 효과적임을 확인했다. 이 설정을 397B 모델에 적용한 '영웅 실행'에서는 35B 모델보다 관리 컨설팅 분야에서 가장 큰 성능 향상을 보였다. 학습에 사용된 MCP 기반 하네스(Archipelago)와 다른 코드 기반 하네스(OpenCode)에서도 성능 향상이 대부분 전이되어, 포스트 트레이닝된 모델이 특정 스캐폴드에 고정되지 않은 재사용 가능한 자산임을 입증했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.