AI Briefing

llama.cpp MTP 지원 반영

llama.cpp MTP support landed - Qwen3.6 27B at 2.44× on a Strix Halo, 2.17× on a RTX 3090 rig

·2026.05.19 04:01

llama.cpp에 MTP speculative decoding이 추가돼 Qwen3.6 27B 속도가 최대 2.44배 빨라졌다.

llama.cpp 메인라인에 MTP speculative decoding이 반영됐다. PR #22673(커밋 4f13cb7)이 5월 16일 머지됐고, --spec-type draft-mtp --spec-draft-n-max N으로 활성화한다. 같은 seed와 temperature에서는 기준 실행과 byte-identical한 출력을 낸다.

Qwen3.6 27B 단일 스트림 채팅 벤치에서는 속도 향상이 확인됐다.

  • Strix Halo(Framework Desktop, ROCm 7.0.2): Q4_K_M 11.7 → 21.2 tok/s(1.81배), Q8_0 7.4 → 18.1 tok/s(2.44배)
  • RTX 3090 1장(CUDA 12.9, driver 590.26): Q4_K_M 38.7 → 59.5 tok/s(1.54배, n=2)
  • RTX 3090 2장 layer-split: Q8_0 25.7 → 55.9 tok/s(2.17배, n=3)

Qwen3.6 35B-A3B MoE에서는 개선 폭이 더 작았다.

  • Strix Halo: 49.5 → 69.4 tok/s(1.40배)
  • RTX 3090: 120.0 → 148.3 tok/s(1.24배)

작성자는 MoE가 토큰당 약 3B/35B 파라미터만 돌기 때문에 speculative decoding의 절대적인 이득이 줄어든다고 설명했다. 또 이전 3090 벤치는 200W cap 때문에 낮게 측정됐다고 정정했고, 350W/450W로 다시 재벤치한 결과 dense 27~32B 모델에서 +70%~+113% 향상을 확인했다. 벤치마크 페이지에는 이제 prompt-processing tok/sprompt-token 열도 추가됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.