llama.cpp MTP 지원 베타 공개
Llama.cpp MTP support now in beta!
·2026.05.04 21:54
핵심 내용
llama.cpp가 MTP(Multi Token Prediction) 지원을 베타로 추가했다.
자세히 보기
llama.cpp에 MTP(Multi Token Prediction) 지원이 베타로 추가됐다. MTP 모델은 같은 GGUF에서 자동 로드되며, 별도 컨텍스트와 KV cache를 쓴다.
- 여러
ubatch를 거칠 때 hidden feature가 전달되지 않던 문제를 막기 위해, 각ubatch뒤에 MTP가 소비하는 별도 hook을 추가했다. - Qwen3.6 27B 벤치에서
--spec-type mtp --spec-draft-n-max 3설정은 평균 수락률 **72.18%**를 기록했고, 총 wall time은 201.07초 → 83.8초로 줄었다. - 기본 벤치는 7.0~7.7 tok/s였고, MTP 적용 시에는 13.9~21.6 tok/s까지 올라갔다.
MTP용 GGUF와 convert_hf_to_gguf.py 변경분도 공개돼 llama-server에서 바로 실험할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.