llama.cpp MTP 지원 추가
llama + spec: MTP Support by am17an · Pull Request #22673 · ggml-org/llama.cpp
·2026.05.16 21:11
핵심 내용
llama.cpp에 MTP 지원이 추가되고 Qwen3.6 MTP GGUF가 공개됐다.
자세히 보기
PR #22673가 2026-05-16에 ggml-org:master로 병합되며 llama.cpp에 MTP(Multi Token Prediction) head 지원이 추가됐다.
- 3 draft tokens 기준 수락률은 약 **72%**였고, DGX Spark에서는 baseline 7 tok/s에서 16~21 tok/s로 올라갔다.
- 구현은 Qwen3.6-27B와 Qwen3.6-35B-A3B에서 검증됐으며, 다른 MTP 모델에도 적용될 수 있다고 설명했다.
- Vision input과 tensor/pipeline parallelism은 호환되지만, prompt processing은 D2H embedding 전송 비용 때문에 느려질 수 있다.
ggml-org/Qwen3.6-27B-MTP-GGUF와ggml-org/Qwen3.6-35B-A3B-MTP-GGUF모델 카드는 이 PR 의존성을 명시하고llama.cpp실행 예시를 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.