MTP 헤드 통합 GGUF 출시
mudler/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-MTP-GGUF just released !
·2026.05.31 14:05
MTP 헤드를 통합하여 별도의 드래프트 모델 없이 self-speculative decoding이 가능한 Qwen3.6 GGUF 모델이 출시되었다.
mudler가 APEX(Adaptive Precision for EXpert Models) 기술을 적용한 Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled 모델의 GGUF 양자화 버전을 공개했다.
이번 릴리스의 핵심은 MTP(Multi-Token Prediction) 헤드를 모델 트렁크와 하나의 파일로 번들링했다는 점이다. 이를 통해 llama.cpp 최신 버전에서 별도의 드래프트 모델 없이도 self-speculative decoding을 활성화하여 추론 성능을 최적화할 수 있다.
MTP 헤드가 포함된 버전은 비포함 버전보다 파일 크기가 약 2.5% 더 크다. MTP 헤드의 정밀도는 대부분 Q8_0 수준으로 유지되어 드래프트 정확도를 높임으로써 추론 효율을 극대화했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.