llama.cpp MTP 지원 반영
llama.cpp MTP support landed - Qwen3.6 27B at 2.44× on a Strix Halo, 2.17× on a RTX 3090 rig
·2026.05.19 04:01
핵심 내용
llama.cpp에 MTP speculative decoding이 추가돼 Qwen3.6 27B 속도가 최대 2.44배 빨라졌다.
자세히 보기
llama.cpp 메인라인에 MTP speculative decoding이 반영됐다. PR #22673(커밋 4f13cb7)이 5월 16일 머지됐고, --spec-type draft-mtp --spec-draft-n-max N으로 활성화한다. 같은 seed와 temperature에서는 기준 실행과 byte-identical한 출력을 낸다.
Qwen3.6 27B 단일 스트림 채팅 벤치에서는 속도 향상이 확인됐다.
- Strix Halo(Framework Desktop, ROCm 7.0.2): Q4_K_M 11.7 → 21.2 tok/s(1.81배), Q8_0 7.4 → 18.1 tok/s(2.44배)
- RTX 3090 1장(CUDA 12.9, driver 590.26): Q4_K_M 38.7 → 59.5 tok/s(1.54배, n=2)
- RTX 3090 2장 layer-split: Q8_0 25.7 → 55.9 tok/s(2.17배, n=3)
Qwen3.6 35B-A3B MoE에서는 개선 폭이 더 작았다.
- Strix Halo: 49.5 → 69.4 tok/s(1.40배)
- RTX 3090: 120.0 → 148.3 tok/s(1.24배)
작성자는 MoE가 토큰당 약 3B/35B 파라미터만 돌기 때문에 speculative decoding의 절대적인 이득이 줄어든다고 설명했다. 또 이전 3090 벤치는 200W cap 때문에 낮게 측정됐다고 정정했고, 350W/450W로 다시 재벤치한 결과 dense 27~32B 모델에서 +70%~+113% 향상을 확인했다. 벤치마크 페이지에는 이제 prompt-processing tok/s와 prompt-token 열도 추가됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.