Gemma 4 가속화: multi-token prediction drafters로 더 빠른 inference
·2026.05.06 06:00
Google이 Gemma 4용 MTP drafters를 공개해 inference 속도를 최대 3배 높였다.
Gemma 4 family용 Multi-Token Prediction(MTP) drafters를 공개했다. 특화된 speculative decoding으로 최대 3배의 inference 속도를 내면서도 출력 품질과 reasoning logic은 유지한다고 밝혔다.
표준 LLM inference가 memory-bandwidth 병목에 묶인다는 점에 맞춰, 가벼운 drafter가 여러 토큰을 먼저 제안하고 heavy target model이 이를 병렬 검증한다. 맞으면 전체 draft를 수용하고 추가 토큰까지 생성해, 한 번의 forward pass로 더 긴 출력을 낼 수 있다.
- 응답성 개선: 실시간 chat, voice, agentic workflow의 지연시간을 낮춘다.
- 로컬/엣지 활용: 26B MoE, 31B Dense, E2B, E4B 모델을 PC와 소비자 GPU, 온디바이스 환경에서 더 빠르게 돌릴 수 있다.
- 아키텍처 최적화: target model의 activations를 활용하고 KV cache를 공유해 중복 계산을 줄였다.
- 추가 개선: E2B/E4B에는 embedder clustering을 적용해 final logit 계산 병목을 완화했다.
- 하드웨어 관찰: 26B MoE는 Apple Silicon에서 batch size 4~8일 때 로컬 속도가 약 2.2배 빨라졌고, Nvidia A100에서도 유사한 이득을 확인했다고 설명했다.
모델은 Apache 2.0 라이선스로 제공되며, Hugging Face, Kaggle, transformers, MLX, vLLM, SGLang, Ollama, Google AI Edge Gallery(Android/iOS)에서 바로 사용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.