NVIDIA, Nemotron-Labs-Diffusion 공개
Nemotron-Labs-Diffusion from NVIDIA
·2026.05.20 03:09
NVIDIA가 AR·diffusion·self-speculation을 지원하는 Nemotron-Labs-Diffusion을 공개했다.
Nemotron-Labs-Diffusion은 같은 모델의 attention pattern만 바꿔 AR decoding, diffusion 기반 병렬 디코딩, self-speculation을 모두 지원한다.
핵심은 생성 단계의 병목을 memory-bound에서 compute-bound 쪽으로 옮겨, 한 번 로드한 가중치를 여러 토큰 계산에 재사용하는 데 있다.
주요 포인트는 다음과 같다.
- 3B, 8B, 14B dense LM 패밀리로 제공된다.
- base, instruct, vision-language 변형을 포함한다.
- self-speculation은 diffusion으로 drafting하고 AR로 verification하는 구조다.
- SGLang 기준으로 Qwen3-8B-Eagle3 대비 acceptance length 3배, 속도 2.2배 향상을 दावा한다.
- 같은 accuracy에서 5.9배 tokens per forward를 기록했다고 제시한다.
- 실측 성능으로 DGX Spark에서는 112 tok/s, GB200에서는 850 tok/s를 제시하며, 커스텀 CUDA 커널로 1015 tok/s까지 올렸다고 설명한다.
또한 diffusion speedup-of-light 분석을 통해, 샘플링 개선만으로 단일 사용자 처리량을 현재 최고치 대비 2배 추가 향상시킬 여지가 있다고 본다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.