AI Briefing

llama.cpp MTP 지원 베타 공개

Llama.cpp MTP support now in beta!

·2026.05.04 21:54

핵심 내용

llama.cpp가 MTP(Multi Token Prediction) 지원을 베타로 추가했다.

자세히 보기

llama.cpp에 MTP(Multi Token Prediction) 지원이 베타로 추가됐다. MTP 모델은 같은 GGUF에서 자동 로드되며, 별도 컨텍스트와 KV cache를 쓴다.

  • 여러 ubatch를 거칠 때 hidden feature가 전달되지 않던 문제를 막기 위해, 각 ubatch 뒤에 MTP가 소비하는 별도 hook을 추가했다.
  • Qwen3.6 27B 벤치에서 --spec-type mtp --spec-draft-n-max 3 설정은 평균 수락률 **72.18%**를 기록했고, 총 wall time은 201.07초 → 83.8초로 줄었다.
  • 기본 벤치는 7.0~7.7 tok/s였고, MTP 적용 시에는 13.9~21.6 tok/s까지 올라갔다.

MTP용 GGUF와 convert_hf_to_gguf.py 변경분도 공개돼 llama-server에서 바로 실험할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.