Gemma 4 QAT 모델: 모바일 및 노트북 효율성을 위한 모델 압축 최적화
·2026.06.06 01:00
Google이 모바일 및 에지 기기에서 Gemma 4를 효율적으로 실행할 수 있도록 QAT 기술을 적용한 최적화 모델을 출시했다.
Google이 Gemma 4를 일반 소비자용 GPU와 에지 기기에서 더욱 효율적으로 실행할 수 있도록 QAT(Quantization-Aware Training, 양자화 인식 훈련) 기술을 적용한 새로운 체크포인트를 출시했다.
기존의 사후 양자화(PTQ) 방식과 달리, QAT는 훈련 과정에 양자화 프로세스를 통합하여 모델 압축 시 발생하는 품질 저하를 최소화한다. 이번 출시에는 대중적인 Q4_0 포맷과 모바일 환경에 특화된 새로운 양자화 포맷이 포함되었다.
특히 모바일 기기 최적화를 위해 다음과 같은 기술적 설계를 적용했다:
- 정적 활성화(Static activations): 데이터 스케일링 값을 훈련 단계에서 미리 계산하여 모바일 칩의 연산 부담을 줄이고 응답 속도를 높임
- 채널별 양자화(Channel-wise quantization): 모바일 가속기 설계에 맞춘 데이터 구조로 네이티브 연산 지원
- 타겟형 2비트 양자화(Targeted 2-bit quantization): 토큰 생성 부분은 2비트로 강력하게 압축하고, 핵심 추론 레이어는 높은 정밀도를 유지하여 성능과 용량을 동시에 잡음
- 임베딩 및 KV 캐시 최적화: 어휘 목록과 단기 메모리에 압축을 집중하여 긴 대화 시에도 메모리 점유율을 낮춤
이러한 최적화를 통해 Gemma 4 E2B 텍스트 전용 모델의 경우 메모리 사용량을 1GB 미만으로 줄일 수 있다. 현재 Hugging Face를 통해 GGUF(llama.cpp용) 및 vLLM용 압축 텐서 등 다양한 포맷으로 모델 가중치를 내려받을 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.