AI Briefing

IK_LLAMA의 Qwen MTP 지원

IK_LLAMA now supports Qwen3.5 MTP Support :O

·2026.04.29 23:22

핵심 내용

IK_LLAMA가 Qwen3.5 MTP 지원을 추가했고, MTP 보존 GGUF가 필요하다.

자세히 보기

ik_llama.cpp PR #1698이 머지되며 Qwen 3.5/3.6 MTP 지원이 추가됐다. 현재 적용 범위는 dense 모델로 제한된다.

실행하려면 MTP 레이어가 보존된 GGUF가 필요하다. qwen-35-mtp-gguf 브랜치로 직접 만들 수 있고, 테스트용 Qwen 3.5 27B·Qwen 3.6 27B Q8_0 GGUF도 공개됐다.

벤치마크는 2x RTX 3090, 3회 평균, max tokens 4000 조건에서 측정됐다.

  • Qwen 3.5 27B layer mode: overall 24.8 tok/s에서 32.2 tok/s로 상승했다.
  • Qwen 3.6 27B layer mode: overall 23.3 tok/s에서 29.6 tok/s로 상승했다.
  • graph mode에서도 두 모델 모두 MTP 적용 시 더 높은 처리량을 기록했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.