AI Briefing

llama.cpp MTP 지원 추가

llama + spec: MTP Support by am17an · Pull Request #22673 · ggml-org/llama.cpp

·2026.05.16 21:11

llama.cpp에 MTP 지원이 추가되고 Qwen3.6 MTP GGUF가 공개됐다.

PR #22673가 2026-05-16에 ggml-org:master로 병합되며 llama.cpp에 MTP(Multi Token Prediction) head 지원이 추가됐다.

  • 3 draft tokens 기준 수락률은 약 **72%**였고, DGX Spark에서는 baseline 7 tok/s에서 16~21 tok/s로 올라갔다.
  • 구현은 Qwen3.6-27BQwen3.6-35B-A3B에서 검증됐으며, 다른 MTP 모델에도 적용될 수 있다고 설명했다.
  • Vision inputtensor/pipeline parallelism은 호환되지만, prompt processing은 D2H embedding 전송 비용 때문에 느려질 수 있다.
  • ggml-org/Qwen3.6-27B-MTP-GGUFggml-org/Qwen3.6-35B-A3B-MTP-GGUF 모델 카드는 이 PR 의존성을 명시하고 llama.cpp 실행 예시를 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.