AI Briefing

Orthrus-Qwen3: Qwen3에서 최대 7.8배 tokens/forward, 동일한 출력 분포

·2026.05.16 07:38

Qwen3 기반 Orthrus가 lossless 병렬 생성으로 최대 7.8배 빨라졌다.

Orthrus는 Qwen3 백본 위에 dual-view diffusion을 얹어 autoregressive LLM의 정확도와 diffusion 모델의 병렬 생성을 결합한 프레임워크다. strictly lossless generation을 내세우며, base model의 예측 분포와 같은 출력을 유지한다고 설명한다.

  • 공개 모델: Qwen3-1.7B / 4B / 8B
  • 평균 속도 향상: 4.25배, 5.20배, 5.36배
  • 생성 효율: forward당 검증 토큰 수를 최대 7.8배까지 높였다고 제시
  • 학습 방식: 베이스 LLM을 고정하고 전체 파라미터의 **16%**만 미세조정
  • 구조: autoregressive view와 diffusion view가 동일한 KV cache를 공유해 메모리 오버헤드를 O(1) 수준으로 유지

비교 실험에서는 EAGLE-3, DFlash 같은 speculative decoding 계열과 다른 diffusion LLM보다 긴 컨텍스트와 MATH-500에서 속도와 정확도 균형을 강조한다. vLLMSGLang 네이티브 통합은 예정 상태다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.