Orthrus-Qwen3-8B 7.8배 가속
Orthrus-Qwen3-8B : up to 7.8×tokens/forward on Qwen3-8B, frozen backbone, provably identical output distribution
·2026.05.16 04:07
Orthrus는 frozen backbone을 유지한 채 Qwen3-8B 추론을 최대 7.8배 가속한다고 밝혔다.
Orthrus는 frozen AR Transformer의 각 layer에 trainable diffusion attention module을 넣어, 한 번에 K=32 토큰을 병렬 제안하고 AR head가 2차 패스로 longest matching prefix를 검증한다.
두 head는 하나의 KV cache를 공유해 외부 drafter 없이 동작하며, 논문은 이 구조가 base model과 동일한 output distribution을 유지한다고 주장한다.
- Qwen3-8B에서 최대 7.8× tokens/forward를 기록했다.
- MATH-500에서 약 6× wall-clock 가속을 보고했다.
- 전체 파라미터의 **16%**만 학습했고, 1B tokens 미만과 8× H200 24시간으로 학습했다.
- Dream, Fast-dLLM-v2, SDAR, Mercury, Gemini Diffusion과 비교해 backbone을 바꾸지 않으면서도 Qwen3-8B 정확도와 일치했다고 설명한다.
- EAGLE-3, DFlash 같은 speculative decoding 대비 별도 drafter가 없고, TTFT penalty가 없으며, KV 오버헤드는 O(1) 수준의 약 4.5 MiB로 고정된다.
- MATH-500 평균 acceptance length는 11.7로, DFlash(7.9)와 EAGLE-3(3.5)보다 길었다.
- single-step denoising이 multi-step보다 좋았고(6.35 vs. 3.53 TPF), KL distillation이 CE보다 acceptance rate가 높았다.
한계도 분명하다. frozen base model의 편향·환각·지식 공백을 그대로 따르고, 평가는 Qwen3-only이며 greedy + rejection sampling으로 제한된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.