KV 캐시 35%↓
KV cache compression on Qwen 3.6 (1M context): 10.7GB → 6.9GB, V ≈ 3.5× smaller
·2026.04.19 11:21
핵심 내용
Qwen 3.6 1M 컨텍스트에서 KV cache를 압축해 10.7GB→6.9GB로 줄였다.
자세히 보기
A100 40GB에서 Qwen 3.6 long-context(1M) 모델을 HF Transformers로 돌리며, attention block에 작은 forward hook을 넣어 K와 V를 분리 압축했다.
- V는 INT2/INT3 per-channel로 공격적으로 압축
- K는 더 높은 정밀도를 유지해 softmax 불안정을 피함
- eviction/token dropping 없이 전체 KV cache를 유지
초기 결과에서는 KV cache 메모리 10.7GB → 6.9GB로 줄었고, V만 보면 약 3.5배 작아졌다.
생성 품질은 정성적으로 안정적으로 보였고, 초기 러닝에서 perplexity 변화도 거의 없었지만 seed가 3개 정도라 아직 결론 내리기엔 이르다.
흥미로운 점은 다음과 같다.
- V가 예상보다 훨씬 더 압축 가능했다
- 같은 메모리 예산에서는 rank reduction(SVD 스타일) 이 더 빨리 무너졌다
- Qwen 자체가 이미 최적화가 잘 되어 있어, 다른 모델보다 절감 폭은 작았다
아직은 어디서 깨지는지 확인하는 단계이며, 작성자는 kvpress, KIVI, H2O 같은 방식과의 비교와 Llama 3 / Mistral 적용 사례를 추가로 궁금해하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.