AI Briefing

llama.cpp MTP 지원 베타 공개

Llama.cpp MTP support now in beta!

·2026.05.04 21:54

llama.cpp가 MTP(Multi Token Prediction) 지원을 베타로 추가했다.

llama.cppMTP(Multi Token Prediction) 지원이 베타로 추가됐다. MTP 모델은 같은 GGUF에서 자동 로드되며, 별도 컨텍스트와 KV cache를 쓴다.

  • 여러 ubatch를 거칠 때 hidden feature가 전달되지 않던 문제를 막기 위해, 각 ubatch 뒤에 MTP가 소비하는 별도 hook을 추가했다.
  • Qwen3.6 27B 벤치에서 --spec-type mtp --spec-draft-n-max 3 설정은 평균 수락률 **72.18%**를 기록했고, 총 wall time은 201.07초 → 83.8초로 줄었다.
  • 기본 벤치는 7.0~7.7 tok/s였고, MTP 적용 시에는 13.9~21.6 tok/s까지 올라갔다.

MTP용 GGUF와 convert_hf_to_gguf.py 변경분도 공개돼 llama-server에서 바로 실험할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.