Gemma 4 가속하기: 다중 토큰 예측 drafter로 더 빠른 추론
·2026.05.06 10:10
Google이 Gemma 4용 MTP drafter를 공개해 추론 속도를 최대 3배 높였다.
Google은 Gemma 4 공개 몇 주 만에 다운로드가 6,000만 회를 넘었다고 밝히고, 제품군용 MTP drafter를 공개했다. 이 drafter는 speculative decoding 기반으로 여러 미래 토큰을 먼저 제안하고, 대상 모델이 이를 병렬 검증해 최종 출력을 확정한다.
이 방식의 목표는 품질 저하 없이 최대 3배 빠른 추론이다. 표준 LLM 추론이 토큰마다 거대한 가중치를 VRAM에서 옮기느라 메모리 대역폭에 묶이는 문제를 줄이기 위해, 가벼운 drafter가 연산을 선제적으로 분담한다. 대상 모델이 초안 토큰을 받아들이면 한 번의 순전파로 시퀀스를 처리하고, 추가 토큰 하나까지 함께 생성한다.
Google은 MTP drafter가 Gemma 4의 활성값과 KV cache를 공유해 중복 계산을 줄인다고 설명했다. 특히 E2B/E4B edge 모델에는 효율적인 embedder clustering을 적용해 최종 로짓 계산 병목을 완화했다.
- 테스트 및 최적화 대상: LiteRT-LM, MLX, Hugging Face Transformers, vLLM
- 공식 예시: Gemma 4 26B를 NVIDIA RTX PRO 6000에서 돌렸을 때 같은 품질로 대기 시간이 절반 수준
- 제공 위치: Hugging Face, Kaggle
- 라이선스: Apache 2.0
- 활용 경로: transformers, MLX, vLLM, SGLang, Ollama, Google AI Edge Gallery
Google은 이 속도 향상이 로컬 개발, 에이전트형 워크플로, 온디바이스 추론의 응답성을 높일 수 있다고 강조했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.