Ollama KV 캐시 설정의 함정
OLLAMA_KV_CACHE_TYPE is global, not per-model. That is why one model got noticeably worse when you quantised the cache and the others did not.
·2026.08.28 06:20
핵심 내용
Ollama의 KV 캐시 양자화 설정은 전역으로 적용되어 특정 모델의 성능 저하를 유발할 수 있다.
자세히 보기
Ollama의 OLLAMA_KV_CACHE_TYPE 설정은 모델별로 개별 적용되지 않고 서버에 로드되는 모든 모델에 전역적으로 적용된다. 이 설정은 메모리 효율을 높이기 위해 사용되지만, 문서에 따르면 모델별 오버라이드 기능이 존재하지 않는다.
양자화 방식별 성능 및 메모리 영향
- f16: 기본값으로 높은 정밀도와 높은 메모리 사용량을 보인다.
- q8_0: f16 대비 약 절반의 메모리를 사용하며, 품질 손실은 일반적으로 미미하다.
- q4_0: f16 대비 약 4분의 1의 메모리를 사용하지만, 품질 손실이 작지 않다. 특히 컨텍스트 길이가 길어질수록 품질 저하가 더 뚜렷해진다.
모델별 영향의 불균형
캐시 양자화의 영향은 모델 구조에 따라 달라진다. Ollama 공식 문서에 따르면 GQA(Grouped Query Attention) 카운트가 높은 모델은 낮은 모델보다 정밀도 손실이 더 클 수 있다. 문서에서는 Qwen2 계열을 GQA 카운트가 높은 예시로 명시했다. 따라서 동일한 전역 설정 하에서도 일부 모델만 성능이 저하되는 현상은 랜덤한 오류가 아니라 구조적 특성에 기인한 것이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.