추천Gemma 4 QAT 모델: 모바일 및 노트북 효율을 위한 모델 압축 최적화
·2026.06.06 01:18
Google이 모바일 및 노트북 환경의 효율성을 높이기 위해 QAT 기술을 적용한 Gemma 4 모델을 출시했다.
Google이 Gemma 4의 효율성을 극대화하기 위해 양자화 인식 훈련(Quantization-Aware Training, QAT) 기술이 적용된 새로운 체크포인트를 출시했다. 이를 통해 사용자는 일반적인 에지 디바이스와 소비자용 GPU에서도 모델을 로컬로 실행할 수 있다.
기존의 사후 양자화(Post-Training Quantization, PTQ) 방식은 성능 저하가 발생하기 쉽지만, QAT는 훈련 과정에서 양자화를 시뮬레이션하여 모델 압축 시 발생하는 품질 손실을 최소화한다.
이번 출시에는 대중적인 Q4_0 포맷과 모바일 환경에 특화된 새로운 양자화 포맷이 포함되었다. 특히 모바일 특화 포맷을 사용하면 Gemma 4 E2B 모델의 메모리 점유율을 1GB 미만으로 줄일 수 있다.
모바일 기기 최적화를 위해 다음과 같은 기술이 적용되었다:
- 정적 활성화(Static activations): 데이터 스케일링 계산을 훈련 중에 미리 수행하여 모바일 칩의 작업 부하를 줄임
- 채널별 양자화(Channel-wise quantization): 모바일 가속기 설계에 맞춰 데이터를 구조화하여 연산 속도 향상
- 타겟형 2비트 양자화(Targeted 2-bit quantization): 토큰 생성 부분은 2비트로 강력하게 압축하고, 핵심 추론 레이어는 높은 정밀도를 유지
- 임베딩 및 KV 캐시 최적화: 어휘 목록과 단기 메모리 압축에 집중하여 활성 메모리 사용량 절감
해당 모델은 Hugging Face를 통해 다운로드할 수 있으며, llama.cpp를 위한 GGUF 포맷과 vLLM을 위한 압축 텐서 형태로 제공된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.