Domino: 추론 속도 5.8배 향상
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
·2026.06.06 21:16
핵심 내용
Speculative Decoding의 효율을 높이기 위해 모델링과 초안 작성을 분리하는 Domino 기술이 발표되었습니다.
자세히 보기
Speculative Decoding의 효율을 극대화하기 위해 Causal Modeling과 Autoregressive Drafting을 분리하는 새로운 방법론인 Domino가 공개되었습니다.
Qwen 모델을 대상으로 한 테스트 결과, 기존 방식 대비 최대 5.8배의 처리량(throughput) 향상을 달성했습니다.
현재 관련 논문, 소스 코드 및 모델 가중치는 arXiv, GitHub, Hugging Face를 통해 모두 공개되어 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.