AI Briefing

Hub Bucket을 활용한 1조 파라미터 전송: TRL의 Delta Weight Sync

·2026.05.27 23:14

TRL 라이브러리에 변경된 가중치만 전송하는 Delta Weight Sync 기능을 추가하여 RL 학습 시 대역폭 소모를 획기적으로 줄였다.

비동기 강화학습(Async RL)에서는 매 단계마다 모델 전체를 추론 엔진으로 전송해야 하는 문제가 있습니다. 7B 모델은 약 14GB, 1T 규모의 모델은 1TB에 달하는 데이터를 매번 전송해야 하므로 막대한 대역폭이 소모되고 GPU 유휴 시간이 발생합니다.

TRL 라이브러리에 도입된 Delta Weight Sync는 연속된 RL 단계 사이에서 가중치의 약 98~99%가 동일하다는 점을 이용합니다. 변경된 부분만 sparse safetensors 파일로 만들어 Hugging Face Bucket에 업로드하고, vLLM이 이를 가져오는 방식입니다.

이 기술을 통해 Qwen3-0.6B 모델의 단계별 페이로드를 1.2GB에서 20~35MB로 대폭 줄였습니다. 이를 통해 학습기와 추론 엔진이 서로 다른 클러스터에 있더라도 직접적인 네트워크 연결(RDMA, VPN 등) 없이 공유 스토어를 통해 효율적인 분산 학습을 수행할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.