llama.cpp, MTP 개선 반영
Time to update llama.cpp to get som MTP improvements!
·2026.05.19 21:35
llama.cpp의 MTP 관련 버그 수정과 speculative decoding 개선이 반영됐다.
llama.cpp의 MTP clean-up PR #23269가 5월 19일 master에 병합됐다.
핵심 수정은 다음과 같다.
- 재귀 롤백(
n_rs_seq > 0)이 있는 병렬 디코딩 버그를 고쳤다. --spec-draft-p-min이 다시 동작하며 기본값은 0.0으로 돌아갔다.--spec-draft-n-max기본값을 16 → 3으로 낮췄다.- 모든 speculative 구현이 채택된 토큰을 공유하도록 바꿔, 여러 speculative 방식을 연동할 때 수용률을 높였다.
ngram-k4v파라미터 전달과batch.token && batch.embd그래프 재사용 문제를 수정했다.
저자는 MTP가 포함된 병렬 디코딩은 아직 최적화가 부족해 더 큰 리팩터링이 필요하다고 설명했다. 대신 시작 로그에 speculative type별 설정이 출력되고, 여러 spec 방식을 함께 쓰는 예시가 추가됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.