AI Briefing

Gemma 4 MTP 은폐 후 커뮤니티가 파헤치고, Google이 뒤늦게 우회 지원

·2026.05.06 13:00

Google이 Gemma 4의 MTP 기능을 공개 배포판에서 제외했다가 커뮤니티의 발견 이후 보조 모델 형태로 지원을 시작했다.

Google이 Gemma 4 모델의 MTP(Multi-Token Prediction) 아키텍처를 공개 가중치(HuggingFace)에서 제외했다가, 커뮤니티의 리버스 엔지니어링으로 사실이 밝혀진 후 보조 모델을 통해 뒤늦게 지원을 시작했다.

오픈소스 개발자들이 엣지 디바이스용 .litertlm 파일을 분석하던 중, 표준 모델 가중치에는 없는 MTP 구조가 포함되어 있음을 발견했다. MTP는 한 번의 연산으로 여러 토큰을 동시에 예측하여, 투기적 디코딩(Speculative Decoding)과 결합 시 출력 품질 저하 없이 추론 속도를 대폭 향상시키는 기술이다.

커뮤니티의 분석 결과, MTP 적용 시 코드 생성 작업에서 기존 대비 **약 3배(8 tps → 25 tps)**의 속도 향상이 확인되었다. 이는 일반적인 투기적 디코딩의 성능 향상 폭(1.5~2x)을 크게 상회하는 수치다.

커뮤니티의 비판이 거세지자 Google은 5월 초, **gemma4_assistant**라는 약 500M 파라미터 규모의 경량 드래프터(Drafter) 모델을 HuggingFace에 별도로 공개했다. 이를 통해 사용자는 assistant_model 인자를 사용하여 복잡한 구현 없이도 Gemma 4의 MTP 기능을 활용할 수 있게 되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.