AI Briefing

IK_LLAMA의 Qwen MTP 지원

IK_LLAMA now supports Qwen3.5 MTP Support :O

·2026.04.29 23:22

IK_LLAMA가 Qwen3.5 MTP 지원을 추가했고, MTP 보존 GGUF가 필요하다.

ik_llama.cpp PR #1698이 머지되며 Qwen 3.5/3.6 MTP 지원이 추가됐다. 현재 적용 범위는 dense 모델로 제한된다.

실행하려면 MTP 레이어가 보존된 GGUF가 필요하다. qwen-35-mtp-gguf 브랜치로 직접 만들 수 있고, 테스트용 Qwen 3.5 27B·Qwen 3.6 27B Q8_0 GGUF도 공개됐다.

벤치마크는 2x RTX 3090, 3회 평균, max tokens 4000 조건에서 측정됐다.

  • Qwen 3.5 27B layer mode: overall 24.8 tok/s에서 32.2 tok/s로 상승했다.
  • Qwen 3.6 27B layer mode: overall 23.3 tok/s에서 29.6 tok/s로 상승했다.
  • graph mode에서도 두 모델 모두 MTP 적용 시 더 높은 처리량을 기록했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.