WaveFront Decoding, 루프형 LLM 속도 4.81배 향상
[Paper] WaveFront Decoding: Parallelized Self-Speculative Decoding for Looped Language Models
·2026.10.06 22:18
핵심 내용
WFD 프레임워크가 초안과 검증을 동시 배치해 Huginn-3.5B에서 4.81배 속도 향상을 달성했다.
자세히 보기
WaveFront Decoding(WFD)은 반복 적용되는 가중치 공유 블록으로 유효 깊이를 높이는 루프형 언어 모델의 높은 지연 시간을 줄이기 위해 설계된 학습 없는 자체 추측 디코딩 프레임워크다.
작동 방식
WFD는 두 가지 아키텍처 특성을 활용한다. 가중치 공유 덕분에 서로 다른 위치와 재귀 깊이의 토큰 상태를 단일 배치로 처리할 수 있으며, 얕은 깊이의 상태로 새 위치의 예측을 효과적으로 초안 작성할 수 있다. 시스템은 이러한 혼합 깊이 상태를 웨이브프론트로 구성해, 얕은 깊이에서 새 위치를 계속 초안 작성하면서 이전 위치는 전체 깊이 검증으로 진행시킨다. 기존 초안 작성 후 검증 방식과 달리, WFD는 재귀 호출 내에서 초안 작성과 검증을 동시에 배치 처리하며, 전체 깊이 예측을 통해 거부된 초안을 수정한다.
성능 벤치마크
Spec-Bench의 6개 작업 카테고리에서 WFD는 기존 초안 작성 후 검증 방식을 일관되게 능가했다.
- Ouro-2.6B: 자기회귀 디코딩 대비 2.42배 속도 향상.
- Huginn-3.5B: 3.54배 속도 향상.
- 최적화된 Huginn-3.5B: 트래픽을 줄이기 위해 재귀 간 KV 공유를 적용하면 속도 향상이 4.81배까지 증가한다.
코드는 GitHub에서, 논문은 arXiv에서 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.