AI Briefing

Domino: 추론 속도 5.8배 향상

Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

·2026.06.06 21:16

Speculative Decoding의 효율을 높이기 위해 모델링과 초안 작성을 분리하는 Domino 기술이 발표되었습니다.

Speculative Decoding의 효율을 극대화하기 위해 Causal ModelingAutoregressive Drafting을 분리하는 새로운 방법론인 Domino가 공개되었습니다.

Qwen 모델을 대상으로 한 테스트 결과, 기존 방식 대비 최대 5.8배의 처리량(throughput) 향상을 달성했습니다.

현재 관련 논문, 소스 코드 및 모델 가중치는 arXiv, GitHub, Hugging Face를 통해 모두 공개되어 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.