Gemma 4 QAT MTP 헤드 공개 및 오류 수정
QAT MTP Heads Upload + PARALLEL=2 Fix + 12B 2-slot Bench
·2026.06.07 06:41
Gemma 4 QAT 모델용 MTP 헤드 공개와 llama.cpp 병렬 실행 오류 수정 소식이다.
Google의 공식 Gemma 4 QAT Q4_0 모델과 매칭되는 MTP(Multi-Token Prediction) 어시스턴트 헤드가 HuggingFace에 공개되었다.
이 헤드들은 추측 디코딩(Speculative Decoding) 시 기존 비-QAT 헤드와 QAT 모델 간의 분포 차이로 인해 발생하는 성능 저하를 해결한다. 테스트 결과, QAT 전용 헤드 사용 시 모델별 수락률(Acceptance Rate)이 다음과 같이 크게 향상되었다:
- 12B QAT: 71.3% → 78.4% (+7%p)
- 26B-A4B QAT: 56.9% → 91.8% (+35%p)
- 31B QAT: 42.5% → 60.4% (+18%p)
또한, Atomic 포크 및 llama.cpp에서 발생하던 PARALLEL=2 설정 시의 크래시 오류를 수정하였으며, 해당 버그를 llama.cpp 공식 저장소에 제출했다. 공개된 헤드는 gemma4_assistant 아키텍처를 사용하며, 현재 Atomic TurboQuant 포크에서 즉시 사용 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.