Orthrus: Diffusion 기반 병렬 토큰 생성 기술 공개
Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion [R]
·2026.05.16 02:21
Diffusion 모듈을 활용해 기존 Transformer의 정확도를 유지하며 토큰 생성 속도를 최대 7.8배 높인 Orthrus를 공개했다.
Orthrus는 고정된(frozen) AR Transformer 레이어에 학습 가능한 Diffusion Attention 모듈을 주입하여 병렬 토큰 생성을 수행하는 기술이다.
핵심 메커니즘:
- Dual-View 구조: Diffusion 헤드와 AR 헤드가 하나의 KV 캐시를 공유한다.
- 병렬 생성 및 검증: Diffusion 헤드가 32개의 토큰을 병렬로 투영하면, AR 헤드가 두 번째 패스에서 이를 검증하고 가장 긴 일치 접두사(prefix)를 채택한다.
- 정확도 유지: 출력 분포가 베이스 모델과 수학적으로 동일하여, 기존 Diffusion LM들과 달리 모델의 정확도 손실이 없다.
주요 성과:
- 속도 향상: MATH-500 벤치마크 기준, 토큰 생성 속도(TPF)를 최대 7.8배, 실제 실행 시간(wall-clock)을 약 6배 개선했다.
- 효율성: Speculative Decoding과 달리 별도의 Drafter 모델이나 추가 캐시가 필요 없어 TTFT(Time-To-First-Token) 페널티가 없으며, KV 오버헤드는 약 4.5 MiB로 매우 낮다.
- 학습 효율: 전체 파라미터의 16%만 학습하며, 8×H200 환경에서 24시간 내에 학습이 가능하다.
한계점:
- 베이스 모델의 편향, 환각, 지식 격차를 그대로 계승한다.
- 현재 Qwen3 모델에 대해서만 평가되었으며, Greedy 및 Rejection Sampling 방식만 지원한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.