IK_LLAMA의 Qwen MTP 지원
IK_LLAMA now supports Qwen3.5 MTP Support :O
·2026.04.29 23:22
핵심 내용
IK_LLAMA가 Qwen3.5 MTP 지원을 추가했고, MTP 보존 GGUF가 필요하다.
자세히 보기
ik_llama.cpp PR #1698이 머지되며 Qwen 3.5/3.6 MTP 지원이 추가됐다. 현재 적용 범위는 dense 모델로 제한된다.
실행하려면 MTP 레이어가 보존된 GGUF가 필요하다. qwen-35-mtp-gguf 브랜치로 직접 만들 수 있고, 테스트용 Qwen 3.5 27B·Qwen 3.6 27B Q8_0 GGUF도 공개됐다.
벤치마크는 2x RTX 3090, 3회 평균, max tokens 4000 조건에서 측정됐다.
- Qwen 3.5 27B layer mode: overall 24.8 tok/s에서 32.2 tok/s로 상승했다.
- Qwen 3.6 27B layer mode: overall 23.3 tok/s에서 29.6 tok/s로 상승했다.
- graph mode에서도 두 모델 모두 MTP 적용 시 더 높은 처리량을 기록했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.