AI Briefing

llama.cpp MTP 지원 추가

llama + spec: MTP Support by am17an · Pull Request #22673 · ggml-org/llama.cpp

·2026.05.16 21:11

핵심 내용

llama.cpp에 MTP 지원이 추가되고 Qwen3.6 MTP GGUF가 공개됐다.

자세히 보기

PR #22673가 2026-05-16에 ggml-org:master로 병합되며 llama.cpp에 MTP(Multi Token Prediction) head 지원이 추가됐다.

  • 3 draft tokens 기준 수락률은 약 **72%**였고, DGX Spark에서는 baseline 7 tok/s에서 16~21 tok/s로 올라갔다.
  • 구현은 Qwen3.6-27B와 Qwen3.6-35B-A3B에서 검증됐으며, 다른 MTP 모델에도 적용될 수 있다고 설명했다.
  • Vision input과 tensor/pipeline parallelism은 호환되지만, prompt processing은 D2H embedding 전송 비용 때문에 느려질 수 있다.
  • ggml-org/Qwen3.6-27B-MTP-GGUF와 ggml-org/Qwen3.6-35B-A3B-MTP-GGUF 모델 카드는 이 PR 의존성을 명시하고 llama.cpp 실행 예시를 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.