AI Briefing

Qwen3.6-35B MTP 적용, 추론 속도 1.49배 향상

Qwen3.6-35B-A3B Hi-Fi MTP runtime verified in llama-server: ~76% acceptance, 1.49× decode speedup

·2026.05.30 05:48

핵심 내용

Qwen3.6-35B-A3B 모델에 MTP를 적용하여 llama-server에서 약 1.49배의 디코딩 속도 향상을 달성했다.

자세히 보기

Qwen3.6-35B-A3B 모델의 Hi-Fi MTP 런타임 버전이 공개되었습니다. 이 모델은 MTP(Multi-Token Prediction) 드래프트 헤드를 포함하고 있어, llama-server에서 네이티브 **투기적 디코딩(Speculative Decoding)**을 지원합니다.

A100-80GB GPU 환경에서 테스트한 결과, 75.99%의 드래프트 토큰 수락률을 기록하며 기존 방식 대비 약 1.49배의 디코딩 속도 향상을 확인했습니다. (기존 133.6 tok/s $\rightarrow$ MTP 적용 시 약 199 tok/s)

주요 성능 지표 및 특징은 다음과 같습니다:

  • 채팅 템플릿 활용: /v1/chat/completions 엔드포인트와 Qwen 채팅 템플릿을 사용할 때 최적의 성능(수락률 ~76%, 속도 1.49배)이 나타납니다. 템플릿 없이 원시 프롬프트를 사용할 경우 수락률은 63%로 떨어집니다.
  • 드래프트 윈도우($k$) 최적화: 테스트 결과 **$k=4$**일 때 가장 높은 성능을 보였으며, $k$값이 커질수록 드래프트 헤드의 예측 오류가 누적되어 수락률이 급격히 저하됩니다.
  • 도메인별 수락률: 코드(73.7%), 수학(78.1%), 일반(76.6%) 분야에서 고른 성능을 보였습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.