AI Briefing

DFlash 및 Spec V2 디코딩 기술

·2026.06.16 09:00

Z Lab과 Modal이 협력하여 개발한 DFlash 기술이 기존 MTP 방식보다 월등한 LLM 추론 성능을 달성했다.

Z Lab, SGLang, Modal은 DFlashSpec V2 엔진을 결합하여 LLM 추론 서비스에서 최첨단 지연 시간(latency)을 구현하는 기술을 공개했다. 특히 Qwen 3.5 397B-A17B 모델을 대상으로 한 벤치마크에서, DFlash는 HumanEval 데이터셋 기준 베이스라인 대비 4.3배, MTP(Multi-Token Prediction) 대비 1.5배 높은 처리량(throughput)을 기록했다.

기존의 Speculative Decoding 방식인 EAGLE나 MTP는 드래프트 모델이 토큰을 하나씩 생성하는 순차적 자기회귀(autoregressive) 방식에 의존하여 하드웨어 효율성이 낮다는 한계가 있었다. 반면 DFlash는 경량 Block Diffusion 드래프트 모델을 사용하여 GPU/TPU 구조에 최적화된 방식으로 한 번에 토큰 블록 전체를 병렬로 생성한다.

DFlash의 핵심 혁신은 KV Injection 전략에 있다. 타겟 LLM의 컨텍스트 토큰에서 은닉 표현(hidden representations)을 추출하여 드래프트 모델에 주입함으로써, 드래프트 모델이 타겟 모델의 문맥을 가장 잘 이해하도록 설계되었다. 이를 통해 낮은 수락 길이(acceptance length) 문제를 해결하고 추론 속도를 획기적으로 높였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.