DFlash 2: 병렬 드래프팅 유지
·2026.08.20 05:28
핵심 내용
Inco AI가 병렬 추론 가속 기술 DFlash 2를 공개하여 처리량을 16~25% 향상시켰다.
자세히 보기
Inco AI가 스펙ulative decoding(추측적 디코딩) 기술인 DFlash 2를 공개했다. 기존 DFlash가 블록 전체를 병렬로 예측하는 방식을 채택했다면, DFlash 2는 검증 패스당 출력량을 20% 이상 늘리면서 지연 시간은 약 1%만 증가하는 효율성을 보인다.
이 기술은 SGLang, vLLM, TensorRT-LLM, llama.cpp 등 주요 추론 엔진에 이미 통합되어 있으며, NVIDIA Blackwell GPU에서는 최대 15배의 처리량 향상이 측정되었다. Hugging Face에서 DFlash 모델은 350만 회 이상 다운로드되었다.
DFlash 2의 핵심은 후보 토큰 목록에서 정답을 더 정확히 선택하는 것이다. 데이터에 따르면 상위 16개 후보 중 정답이 포함될 확률은 **99.5%**에 달하지만, 1위 후보가 정답일 확률은 85.4%에 그친다. DFlash 2는 이러한 후보 목록의 잠재력을 활용하여 블록 끝까지 정확도를 유지하며, Qwen3.8-27B 모델 기준 오토레그레시브 디코딩 대비 2.7~3.4배의 처리량 향상을 달성했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.