AI Briefing

Orthrus-Qwen3-8B 7.8배 가속

Orthrus-Qwen3-8B : up to 7.8×tokens/forward on Qwen3-8B, frozen backbone, provably identical output distribution

·2026.05.16 04:07

핵심 내용

Orthrus는 frozen backbone을 유지한 채 Qwen3-8B 추론을 최대 7.8배 가속한다고 밝혔다.

자세히 보기

Orthrus는 frozen AR Transformer의 각 layer에 trainable diffusion attention module을 넣어, 한 번에 K=32 토큰을 병렬 제안하고 AR head가 2차 패스로 longest matching prefix를 검증한다.

두 head는 하나의 KV cache를 공유해 외부 drafter 없이 동작하며, 논문은 이 구조가 base model과 동일한 output distribution을 유지한다고 주장한다.

  • Qwen3-8B에서 최대 7.8× tokens/forward를 기록했다.
  • MATH-500에서 약 6× wall-clock 가속을 보고했다.
  • 전체 파라미터의 **16%**만 학습했고, 1B tokens 미만과 8× H200 24시간으로 학습했다.
  • Dream, Fast-dLLM-v2, SDAR, Mercury, Gemini Diffusion과 비교해 backbone을 바꾸지 않으면서도 Qwen3-8B 정확도와 일치했다고 설명한다.
  • EAGLE-3, DFlash 같은 speculative decoding 대비 별도 drafter가 없고, TTFT penalty가 없으며, KV 오버헤드는 O(1) 수준의 약 4.5 MiB로 고정된다.
  • MATH-500 평균 acceptance length는 11.7로, DFlash(7.9)와 EAGLE-3(3.5)보다 길었다.
  • single-step denoising이 multi-step보다 좋았고(6.35 vs. 3.53 TPF), KL distillation이 CE보다 acceptance rate가 높았다.

한계도 분명하다. frozen base model의 편향·환각·지식 공백을 그대로 따르고, 평가는 Qwen3-only이며 greedy + rejection sampling으로 제한된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.