Qwen3.6 27B KV cache 실험
Qwen3.6 27B's surprising KV cache quantization test results (Turbo3/4 vs F16 vs Q8 vs Q4)
·2026.04.25 07:46
핵심 내용
3090 eGPU와 200k context에서 Qwen3.6-27B의 KV cache 양자화를 테스트했다.
자세히 보기
Qwen3.6-27B-Q5_K_M을 3090 eGPU와 200k context 환경에서 llama-perplexity.exe로 측정했다.
- KV cache 미양자화 기준 PPL 6.9233 ± 0.04564를 기록했다.
--cache-type-k turbo3 --cache-type-v turbo3등으로 반복 측정했으며, 작성자는 여러 quants가 전반적으로 허용 범위 안에 들어왔다고 적었다.- 사용한 도구와 설정이 함께 제시돼 있어, 같은 모델과 환경에서 재현 가능한 벤치마크 예시로 볼 수 있다.
- 다만 작성자 개인의 경험에 따르면 35B급 모델에서는 turbo3 캐시가 잘 맞지 않았고, 소형 모델은 과도한 V cache 압축에 더 민감할 수 있다고 봤다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.