AI Briefing

DFlash 및 Spec V2 디코딩 기술

·2026.06.16 09:00

핵심 내용

Z Lab과 Modal이 협력하여 개발한 DFlash 기술이 기존 MTP 방식보다 월등한 LLM 추론 성능을 달성했다.

자세히 보기

Z Lab, SGLang, Modal은 DFlash와 Spec V2 엔진을 결합하여 LLM 추론 서비스에서 최첨단 지연 시간(latency)을 구현하는 기술을 공개했다. 특히 Qwen 3.5 397B-A17B 모델을 대상으로 한 벤치마크에서, DFlash는 HumanEval 데이터셋 기준 베이스라인 대비 4.3배, MTP(Multi-Token Prediction) 대비 1.5배 높은 처리량(throughput)을 기록했다.

기존의 Speculative Decoding 방식인 EAGLE나 MTP는 드래프트 모델이 토큰을 하나씩 생성하는 순차적 자기회귀(autoregressive) 방식에 의존하여 하드웨어 효율성이 낮다는 한계가 있었다. 반면 DFlash는 경량 Block Diffusion 드래프트 모델을 사용하여 GPU/TPU 구조에 최적화된 방식으로 한 번에 토큰 블록 전체를 병렬로 생성한다.

DFlash의 핵심 혁신은 KV Injection 전략에 있다. 타겟 LLM의 컨텍스트 토큰에서 은닉 표현(hidden representations)을 추출하여 드래프트 모델에 주입함으로써, 드래프트 모델이 타겟 모델의 문맥을 가장 잘 이해하도록 설계되었다. 이를 통해 낮은 수락 길이(acceptance length) 문제를 해결하고 추론 속도를 획기적으로 높였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.