AI Briefing

KV 캐시 양자화 성능 비교

Great analysis of how the different KV rotation methods perform. Tl;dr: saw is what you want.

·2026.05.02 08:54

핵심 내용

Tesla P40 벤치마크에서 saw 계열 KV 양자화가 가장 안정적이었다.

자세히 보기

WikiText-2 테스트셋에서 ctx 512 기준 teacher-forced PPL과 토큰 속도를 비교했다.

  • 환경은 Tesla P40 24GB였고, dist/bin/perplexity를 ollama-bugfix 브랜치의 turboquant-qjl로 실행했다.
  • 동일한 방법론으로 preset별 PPL, KV MiB, total MiB, decode/prefill tok/s를 측정했다.

Llama 3.2 3B와 Llama 3.1 8B에서는 saw8k가 사실상 무손실이었다. 3B에서는 +0.0012 PPL, 8B에서는 -0.0004 PPL이었고, saw8kv, q8kv, q8_0도 f16과 거의 같았다. 반면 4-bit와 TurboQuant 계열은 손실이 빠르게 커졌다.

Qwen2.5 7B는 attn_k.bias가 커서 int4 step size가 신호를 덮어버렸고, q4k, q4kv, saw4k, saw4kv, q4_0가 모두 GARBAGE PPL을 냈다. 이 모델에서는 int8 계열만 정상 범위였다.

Qwen3.5 9B는 대부분 lossless에 가까웠지만, K-only int4 encode 경로는 nil pointer bug로 크래시가 났다. saw4kv는 별도 경로라 정상 동작했고, q8kv와 saw8k도 안정적이었다.

Gemma4 27B는 non-standard attention 때문에 teacher-forced PPL이 품질 지표로 유효하지 않았고, 실질적으로는 VRAM 절감 여부만 의미가 있었다. f16과 일부 TurboQuant preset은 OOM이었고, fused-path preset만 진입 가능했다.

전체 결론은 saw 계열, 특히 saw8k/saw8kv가 가장 안전하고 재현 가능한 선택이라는 점이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.