NVIDIA, 경량화된 RL 프레임워크 Molt 공개
Molt — a ~9K-line, PyTorch-native RL framework for agentic post-training that scales to hundred-B MoE
·2026.07.14 12:00
NVIDIA가 대규모 MoE 모델의 에이전트 학습을 위해 설계된 PyTorch 네이티브 RL 프레임워크 Molt를 공개했습니다.
NVIDIA NeMo Labs에서 개발한 Molt는 에이전트 중심의 RL(강화학습) 포스트 트레이닝을 위한 프레임워크입니다. 기존 Megatron 기반 프레임워크들이 복잡한 코드 구조로 인해 연구 및 빠른 반복(Iteration)에 어려움이 있었던 점을 해결하기 위해, 핵심 RL 코드를 9,000라인 내외로 최소화하여 가독성과 수정 용이성을 극대화했습니다.
주요 특징은 다음과 같습니다:
- 확장성: Qwen3.5-397B부터 GLM-5.2 753B 규모의 MoE(Mixture-of-Experts) 모델까지 지원합니다.
- 단순한 스택: Megatron 대신 Ray, vLLM, NVIDIA AutoModel/FSDP2만을 사용하여 구현되어 구조가 직관적입니다.
- 비동기 아키텍처: vLLM(Rollout), Agent(Python 기반 환경), Ray(Queue), RL Trainer(FSDP2 기반 업데이트)로 구성된 비동기 루프를 통해 높은 처리량을 유지합니다.
- 유연한 보상 설계: 규칙 기반, 휴리스틱, LLM-as-judge, 도구 반환값 등 임의의 Python 코드를 보상 함수로 사용할 수 있습니다.
이 프레임워크는 토큰 단위의 데이터 경로를 유지하여 Rollout부터 학습까지 데이터 정렬을 보장하며, 연구자들이 대규모 모델에서도 빠르게 아이디어를 실험할 수 있도록 설계되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.