AI Briefing

Qwen KV cache 벤치마크

Qwen 3.6-35B-A3B KV cache part 2: PPL, KL divergence, asymmetric K/V, 64K row on M5 Max

·2026.04.30 05:00

M5 Max에서 Qwen 3.6-35B-A3B KV cache 양자화의 품질과 장문 속도를 재측정했다.

오버나이트로 M5 Max에서 같은 Qwen 3.6-35B-A3B Q8와 같은 TheTom TurboQuant fork(feature/turboquant-kv-cache) 조건으로 KV cache 양자화 품질과 속도를 다시 측정했다.

품질 평가(wikitext-2, context 4096)

  • 512 context로는 KV cache 차이가 잘 드러나지 않아, 효과를 보기 위해 context 4096에서 비교했다.
  • f16 baseline을 --kl-divergence-base로 저장한 뒤 각 양자화 캐시의 PPL, KL divergence, top-1 token agreement를 비교했다.
  • q8_0PPL 5.7433, KL 0.0016, **top-1 98.64%**로 f16(PPL 5.7438)과 사실상 차이가 없었다.
  • turbo3PPL 5.8092, KL 0.0199, **top-1 93.93%**였고, turbo4PPL 5.7810, KL 0.0131, **top-1 95.28%**였다.
  • 압축률이 높아질수록 품질 손실도 함께 커졌지만, q8_0 KV는 이 깊이에서 거의 무손실에 가까웠다.

비대칭 K/V(depth sweep)

  • decode tok/s 기준으로 q8_0 K / turbo4 V 조합이 가장 좋았다: 0 / 8K / 32K / 128K / 256K / 512K에서 각각 82.9 / 75.4 / 66.0 / 41.0 / 27.1 / 16.5 tok/s를 기록했다.
  • q8_0 K / turbo3 V는 그보다 약간 느렸고, f16 K / turbo4 V는 깊은 컨텍스트로 갈수록 크게 느려져 256K 이상은 생략됐다.
  • 특히 q8_0 K / turbo4 V256K에서 이전 대칭 q8_0 수준의 처리량에 근접했고, 대칭 q8_0가 OOM512K까지 동작해 장문 컨텍스트에서 메모리 효율이 두드러졌다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.