AI Briefing

KV 캐시 35%↓

KV cache compression on Qwen 3.6 (1M context): 10.7GB → 6.9GB, V ≈ 3.5× smaller

·2026.04.19 11:21

핵심 내용

Qwen 3.6 1M 컨텍스트에서 KV cache를 압축해 10.7GB→6.9GB로 줄였다.

자세히 보기

A100 40GB에서 Qwen 3.6 long-context(1M) 모델을 HF Transformers로 돌리며, attention block에 작은 forward hook을 넣어 K와 V를 분리 압축했다.

  • V는 INT2/INT3 per-channel로 공격적으로 압축
  • K는 더 높은 정밀도를 유지해 softmax 불안정을 피함
  • eviction/token dropping 없이 전체 KV cache를 유지

초기 결과에서는 KV cache 메모리 10.7GB → 6.9GB로 줄었고, V만 보면 약 3.5배 작아졌다.

생성 품질은 정성적으로 안정적으로 보였고, 초기 러닝에서 perplexity 변화도 거의 없었지만 seed가 3개 정도라 아직 결론 내리기엔 이르다.

흥미로운 점은 다음과 같다.

  • V가 예상보다 훨씬 더 압축 가능했다
  • 같은 메모리 예산에서는 rank reduction(SVD 스타일) 이 더 빨리 무너졌다
  • Qwen 자체가 이미 최적화가 잘 되어 있어, 다른 모델보다 절감 폭은 작았다

아직은 어디서 깨지는지 확인하는 단계이며, 작성자는 kvpress, KIVI, H2O 같은 방식과의 비교와 Llama 3 / Mistral 적용 사례를 추가로 궁금해하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.