Miles v0.1: 프로덕션 레벨 포스트 트레이닝 (20분 읽기)
·2026.08.19 09:00
핵심 내용
RadixArk, 프론티어 규모 RL 학습을 위한 풀스택 시스템 Miles v0.1을 공개했다.
자세히 보기
Miles v0.1은 RadixArk와 에코시스템 파트너들이 공개한 프로덕션 레벨 포스트 트레이닝 시스템으로, 기존 slime의 설계를 기반으로 RL 학습 루프의 모든 단계를 최적화했습니다. 정확도, 효율성, 신뢰성, 확장성을 최우선 목표로 하여 프론티어 규모 RL을 연구자와 개발자에게 접근 가능하게 만듭니다.
Miles의 RL 학습 루프는 롤아웃(Rollout), 트레이닝(Training), 가중치 업데이트(Weight Update) 세 단계로 구성됩니다. SGLang 엔진이 에이전트 환경과 상호작용하며 궤적을 생성하고, Megatron-LM 또는 FSDP 트레이너가 RL 손실을 계산해 정책을 업데이트한 뒤, 최소한의 중단으로 가중치를 동기화합니다.
주요 기술적 특징으로는 다음과 같은 요소가 있습니다.
- 완전 비동기 RL: SGLang 기반의 빠른 에이전트 롤아웃과 비동기 학습을 지원합니다.
- TITO(Token-In-Token-Out) 및 R3(Rollout Routing Replay): 효율적인 토큰 처리와 라우팅 재현을 통해 성능을 높였습니다.
- 저정밀도 학습 및 메모리 효율성: 디스크 오프로드를 통한 메모리 사용량 최적화를 제공합니다.
- 다양한 포스트 트레이닝 레시피: LoRA RL, 온-정책 증류(OPD), 제로-KL 정렬 등을 지원합니다.
Miles는 NVIDIA GB300 GPU 64개를 사용하여 GLM-5.2를 터미널 사용 태스크에 대해 학습시키는 등 실제 하드웨어 환경에서의 검증된 모델 지원과 멀티 하드웨어 호환성을 갖추고 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.