TRL v1.14, NCCL 없는 LoRA Async GRPO 지원
Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
·2026.09.10 09:00
핵심 내용
TRL v1.14가 NCCL 대신 스토리지 버킷과 프록시를 활용해 LoRA 어댑터를 동기화하는 Async GRPO 기능을 공개했다.
1 / 9
자세히 보기
TRL v1.14의 AsyncGRPOTrainer가 LoRA 어댑터 학습을 지원하며, Hugging Face Jobs 환경에서 NCCL 없이 Trainer와 vLLM 간 어댑터를 동기화하는 새로운 아키텍처를 도입했다. Thinking Machines의 'LoRA Without Regret' 연구는 RL에서 rank-1 LoRA가 full fine-tuning과 유사한 성능을 낼 수 있음을 보여주며, 이를 바탕으로 수 MB 규모의 어댑터를 스토리지 버킷을 통해 저장하고 vLLM이 이를 로드하는 방식을 사용한다. 프록시는 인증 헤더를 추가하고, KV 프리픽스를 보유한 레플리카로 롤아웃을 라우팅하며, 어댑터 로드를 모든 레플리카에 브로드캐스트한다.
성능 최적화 및 결과
Qwen2.5-Math-1.5B 모델로 실험한 결과, 500 스텝 기준 wall clock 시간이 3시간 27분에서 53분으로 단축되었고, MFU는 3.9%에서 23.5%로 상승했다. Reward는 첫 20 스텝에서 0.145에서 마지막 20 스텝에서 0.416(run 5 기준)으로 상승하며 유효성을 검증했다.
- 동기화 속도: 가중치 동기화 시간(p50)이 8.5초에서 6.2초로 단축
- 스텝 시간: 스텝당 시간(p50)이 22.9초에서 4.8초로 단축
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.