AI Briefing

Miles: 대규모 LLM RL 사후 학습을 위한 PyTorch 네이티브 스택

·2026.07.01 09:00

RadixArk가 대규모 LLM 강화학습(RL) 사후 학습을 위해 SGLang, Megatron-LM, Ray를 통합한 오픈소스 프레임워크 Miles를 공개했다.

LLM의 사후 학습(Post-training)에서 강화학습(RL)의 비중이 커짐에 따라, 모델 규모가 커지고 MoE(Mixture-of-Experts) 구조가 도입되면서 RL은 단순한 학습 루프를 넘어 복잡한 분산 시스템 문제로 진화하고 있습니다.

Miles는 이러한 문제를 해결하기 위해 설계된 RadixArk의 오픈소스 프레임워크입니다. 이 프레임워크는 고성능 샘플 생성을 위한 SGLang, 확장 가능한 분산 학습을 위한 Megatron-LM, 클러스터 오케스트레이션을 위한 Ray, 그리고 핵심 수치 연산 레이어인 PyTorch를 결합하여 구성됩니다.

Miles의 아키텍처는 '작은 코어와 많은 에지(Small-core, many-edges)' 철학을 따릅니다. 핵심 학습 루프는 간결하게 유지하되, 사용자가 롤아웃 로직, 보상 계산, 손실 함수 등을 Python 모듈 형태로 쉽게 교체할 수 있도록 설계되어 연구자와 인프라 팀 모두의 커스텀 편의성을 높였습니다.

주요 특징은 다음과 같습니다:

  • 고성능 롤아웃 및 학습: SGLang과 Megatron-LM의 통합을 통해 생성과 학습 사이의 병목 현상 해결
  • MoE 최적화: 롤아웃과 학습 단계 간의 라우팅 동작 일치 지원
  • 효율적인 자원 관리: Ray를 이용한 분산 시스템 오케스트레이션 및 GPU 인식 스케줄링
  • 신뢰성 및 관측성: 결함 허용(Fault tolerance), 체크포인팅, 실시간 관측성 기능 내장

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.