Gemma 4 가속화: multi-token prediction drafters로 더 빠른 inference
·2026.05.06 06:00
핵심 내용
Google이 Gemma 4용 MTP drafters를 공개해 inference 속도를 최대 3배 높였다.
1 / 2
자세히 보기
Gemma 4 family용 Multi-Token Prediction(MTP) drafters를 공개했다. 특화된 speculative decoding으로 최대 3배의 inference 속도를 내면서도 출력 품질과 reasoning logic은 유지한다고 밝혔다.
표준 LLM inference가 memory-bandwidth 병목에 묶인다는 점에 맞춰, 가벼운 drafter가 여러 토큰을 먼저 제안하고 heavy target model이 이를 병렬 검증한다. 맞으면 전체 draft를 수용하고 추가 토큰까지 생성해, 한 번의 forward pass로 더 긴 출력을 낼 수 있다.
- 응답성 개선: 실시간 chat, voice, agentic workflow의 지연시간을 낮춘다.
- 로컬/엣지 활용: 26B MoE, 31B Dense, E2B, E4B 모델을 PC와 소비자 GPU, 온디바이스 환경에서 더 빠르게 돌릴 수 있다.
- 아키텍처 최적화: target model의 activations를 활용하고 KV cache를 공유해 중복 계산을 줄였다.
- 추가 개선: E2B/E4B에는 embedder clustering을 적용해 final logit 계산 병목을 완화했다.
- 하드웨어 관찰: 26B MoE는 Apple Silicon에서 batch size 4~8일 때 로컬 속도가 약 2.2배 빨라졌고, Nvidia A100에서도 유사한 이득을 확인했다고 설명했다.
모델은 Apache 2.0 라이선스로 제공되며, Hugging Face, Kaggle, transformers, MLX, vLLM, SGLang, Ollama, Google AI Edge Gallery(Android/iOS)에서 바로 사용할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.