AI Briefing

Qwen3.6-35B MTP 적용, 추론 속도 1.49배 향상

Qwen3.6-35B-A3B Hi-Fi MTP runtime verified in llama-server: ~76% acceptance, 1.49× decode speedup

·2026.05.30 05:48

Qwen3.6-35B-A3B 모델에 MTP를 적용하여 llama-server에서 약 1.49배의 디코딩 속도 향상을 달성했다.

Qwen3.6-35B-A3B 모델의 Hi-Fi MTP 런타임 버전이 공개되었습니다. 이 모델은 MTP(Multi-Token Prediction) 드래프트 헤드를 포함하고 있어, llama-server에서 네이티브 **투기적 디코딩(Speculative Decoding)**을 지원합니다.

A100-80GB GPU 환경에서 테스트한 결과, 75.99%의 드래프트 토큰 수락률을 기록하며 기존 방식 대비 약 1.49배의 디코딩 속도 향상을 확인했습니다. (기존 133.6 tok/s $\rightarrow$ MTP 적용 시 약 199 tok/s)

주요 성능 지표 및 특징은 다음과 같습니다:

  • 채팅 템플릿 활용: /v1/chat/completions 엔드포인트와 Qwen 채팅 템플릿을 사용할 때 최적의 성능(수락률 ~76%, 속도 1.49배)이 나타납니다. 템플릿 없이 원시 프롬프트를 사용할 경우 수락률은 63%로 떨어집니다.
  • 드래프트 윈도우($k$) 최적화: 테스트 결과 **$k=4$**일 때 가장 높은 성능을 보였으며, $k$값이 커질수록 드래프트 헤드의 예측 오류가 누적되어 수락률이 급격히 저하됩니다.
  • 도메인별 수락률: 코드(73.7%), 수학(78.1%), 일반(76.6%) 분야에서 고른 성능을 보였습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.