Qwen 3.6 KV 캐시 벤치
Qwen 3.6-35B-A3B KV cache bench: f16 vs q8_0 vs turbo3 vs turbo4 from 0 to 1M context on M5 Max
·2026.04.29 02:17
M5 Max에서 Qwen 3.6 KV cache 형식별 0~1M 성능 차이를 측정했다.
M5 Max 128GB에서 Qwen 3.6-35B-A3B의 KV cache를 llama-bench로 비교해 0~1M 컨텍스트에서 f16, q8_0, turbo3, turbo4의 성능 곡선을 측정했다.
- K와 V를 같은 타입으로 맞춘 대칭 설정(
-ctk,-ctv)으로 돌렸고,feature/turboquant-kv-cache브랜치와GGML_METAL=ON조합을 사용했다. - 각 셀은 3회 반복했고, flash-attn과
mlock을 켠 상태로 약 8시간 동안 스윕했다. - 0 depth에서는 f16이 prefill 2962 tok/s, decode 89.4 tok/s로 가장 빨랐고, turbo3는 decode가 79.5 tok/s로 약 10% 느렸다.
- 128K에서는 turbo3 prefill이 253 tok/s로 q8_0의 245 tok/s를 넘어섰다. 컨텍스트가 길어질수록 더 작은 cache가 대역폭 부담을 덜었다.
- OOM 한계는 cache 형식별로 크게 달랐다. f16은 256K에서 OOM, q8_0는 512K에서 OOM이었고, turbo3는 1M까지 동작하며 prefill 30 tok/s, decode 6.5 tok/s를 기록했다.
- turbo3와 turbo4는 병목이 달랐다. 256K prefill은 turbo3가 128 tok/s로 turbo4(101 tok/s)보다 빠르지만, decode는 512K에서 turbo4(16.0 tok/s)가 turbo3(13.3 tok/s)를 앞섰다.
초장문 컨텍스트로 갈수록 KV cache 압축이 성능과 메모리 한계를 동시에 좌우했고, prefill과 decode에 따라 최적 cache 타입도 달라졌다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.