KV 캐시 양자화 성능 비교
Great analysis of how the different KV rotation methods perform. Tl;dr: saw is what you want.
핵심 내용
Tesla P40 벤치마크에서 saw 계열 KV 양자화가 가장 안정적이었다.
자세히 보기
WikiText-2 테스트셋에서 ctx 512 기준 teacher-forced PPL과 토큰 속도를 비교했다.
- 환경은 Tesla P40 24GB였고,
dist/bin/perplexity를ollama-bugfix브랜치의turboquant-qjl로 실행했다. - 동일한 방법론으로 preset별 PPL, KV MiB, total MiB, decode/prefill tok/s를 측정했다.
Llama 3.2 3B와 Llama 3.1 8B에서는 saw8k가 사실상 무손실이었다. 3B에서는 +0.0012 PPL, 8B에서는 -0.0004 PPL이었고, saw8kv, q8kv, q8_0도 f16과 거의 같았다. 반면 4-bit와 TurboQuant 계열은 손실이 빠르게 커졌다.
Qwen2.5 7B는 attn_k.bias가 커서 int4 step size가 신호를 덮어버렸고, q4k, q4kv, saw4k, saw4kv, q4_0가 모두 GARBAGE PPL을 냈다. 이 모델에서는 int8 계열만 정상 범위였다.
Qwen3.5 9B는 대부분 lossless에 가까웠지만, K-only int4 encode 경로는 nil pointer bug로 크래시가 났다. saw4kv는 별도 경로라 정상 동작했고, q8kv와 saw8k도 안정적이었다.
Gemma4 27B는 non-standard attention 때문에 teacher-forced PPL이 품질 지표로 유효하지 않았고, 실질적으로는 VRAM 절감 여부만 의미가 있었다. f16과 일부 TurboQuant preset은 OOM이었고, fused-path preset만 진입 가능했다.
전체 결론은 saw 계열, 특히 saw8k/saw8kv가 가장 안전하고 재현 가능한 선택이라는 점이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.