AI Briefing

RL 학습을 위한 Speculative Decoding

·2026.05.01 09:00

핵심 내용

NeMo-RL에 Speculative Decoding을 적용해 RL 롤아웃을 1.8배 높였다.

자세히 보기

프론티어 LLM의 RL post-training은 autoregressive rollout 생성이 병목이 된다. 기존의 off-policy execution, replay, 저정밀 생성처럼 학습 방식을 바꾸는 효율화 대신, 목표 모델의 출력 분포를 유지하는 lossless acceleration으로 Speculative Decoding을 적용했다.

구현은 NeMo-RL에 vLLM 백엔드를 붙인 시스템 통합형 구조이며, synchronous와 asynchronous 파이프라인을 모두 지원한다. RL 롤아웃 중에도 speculation을 사용할 수 있어, 사전학습된 MTP head, 작은 외부 draft model, 그리고 보통 RL 이후에 쓰이던 Eagle3까지 적용 범위를 넓혔다.

성과는 구체적이다.

  • 8B 규모 reasoning post-training 워크로드에서 synchronous RL 기준 rollout throughput이 1.8배 향상됐다.
  • 고충실도 성능 시뮬레이터는 asynchronous RL과 결합하면 235B 규모에서 end-to-end training speedup이 최대 2.5배까지 가능하다고 전망했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.