AI Briefing

Gemma·Qwen KV 캐시 비교

Gemma 4 and Qwen 3.6 with q8_0 and q4_0 KV cache: KL divergence results

·2026.04.24 23:19

Gemma는 KV 캐시 양자화에 민감했고 Qwen은 상대적으로 견딜 만했다.

q8_0 KV 캐시q4_0 KV 캐시f16 기준선과 비교한 결과, 모델별 민감도가 크게 갈렸다.

  • Gemma 4는 q8_0에서도 품질 저하가 뚜렷했고, q4_0에서는 더 크게 무너졌다.
  • Qwen 3.6은 q8_0에서 KL 0.04 미만 수준을 유지했고, q4_0도 일부 구간을 제외하면 실사용 가능한 수준으로 측정됐다.
  • 특히 **Gemma 4 26B A4B(MoE)**는 이번 테스트에서 가장 민감했으며, q8_0 캐시가 KL 0.377, q4_0는 KL 1.088까지 악화됐다.
  • 반면 **Qwen 3.6 35B A3B(MoE)**는 MoE 구조에서도 같은 수준의 증폭 현상이 보이지 않았다.

카테고리별로는 Gemma가 전반적으로 고르게 저하된 반면, Qwen은 긴 문서와 도구 호출에서 손실이 집중됐다.

측정은 BF16 GGUF, 같은 머신, 동일 데이터셋 조건에서 f16 캐시 / q8_0 / q4_0만 바꿔 수행했으며, 약 25만 토큰, 6개 카테고리, KL divergence로 token-by-token 비교했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.