DLoop, LLM 추론 속도 최대 41% 향상
[Paper] DLoop: Looped Speculative Decoding
·2026.10.09 16:18
핵심 내용
DLoop가 반복 드래프팅으로 타깃 모델 추론을 줄여 LLM 추론 속도를 최대 41% 높였다.
자세히 보기
DLoop는 추측 디코딩(speculative decoding)을 반복하는 방식으로, 검증 전에 여러 단계의 드래프팅을 수행해 타깃 모델의 고비용 추론 횟수를 줄인다. 드래프트 모델의 성능이 향상되면서 타깃 모델이 모든 토큰을 수용하는 경우가 늘고, 이로 인해 후속 검증 단계가 불필요해지는 문제를 해결하기 위해 DLoop는 모델이 확신하는 동안 드래프팅을 계속하고 누적된 토큰을 한 번에 검증한다.
작동 원리
- 적응형 드래프팅: 각 단계마다 검증하는 기존 방식과 달리, DLoop는 신뢰도에 기반해 여러 드래프팅 단계를 반복한다.
- 루프 인식 학습: 검증되지 않은 드래프트 토큰에 대한 자체 은닉 상태(hidden states)를 노출해 추가 단계에서도 드래프트 모델의 신뢰성을 유지하도록 학습한다.
- 효율성: 드래프트 모델의 추가 추론을 감수하는 대신 타깃 모델의 추론 횟수를 줄인다.
성능 영향
DLoop는 EAGLE-3, DFlash, Domino, DSpark 및 멀티 토큰 예측 모듈 등 다양한 추측 디코딩 방법과 통합된다. 손실 없는 디코딩을 유지하면서 실제 실행 시간(wall-clock) 기준 **5~41%**의 속도 향상을 달성한다. 코드는 현재 내부 검토 중이며 조만간 GitHub를 통해 공개될 예정이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.