llama.cpp 동적 KV 캐시 양자화 기능
Dynamic KV Cache Quantization and Load-on-demand mmproj/MTP: my llama.cpp wishlist
·2026.06.05 03:52
llama.cpp에 모델 재로드 없이 KV 캐시 양자화 수준을 동적으로 변경하는 기능이 제안되었습니다.
LLM 추론 시 VRAM 사용량, 컨텍스트 길이, 멀티모달(mmproj) 기능 사이의 트레이드오프를 해결하기 위한 새로운 기능이 llama.cpp에 제안되었습니다.
기존에는 KV 캐시 양자화 수준이나 mmproj 사용 여부를 변경하려면 모델 전체를 언로드하고 다시 로드해야 했으며, 이 과정에서 상당한 지연 시간이 발생했습니다. 이를 해결하기 위해 모델 재로드 없이 **KV 캐시(KV Cache)**를 동적으로 재양자화할 수 있는 기능이 구현되었습니다.
주요 구현 내용:
POST /requantize_kvcacheHTTP 엔드포인트 추가- 현재 KV 캐시를 읽고 삭제한 뒤, 원하는 양자화 수준으로 새로운 빈 캐시 생성
- 기존 KV 캐시를 새로운 양자화 형식으로 변환하여 즉시 로드
이 기능이 적용되면 추론 세션 도중에도 상황에 따라 **고정밀 KV 캐시(f16)**와 VRAM 효율적인 양자화 캐시 사이를 빠르게 전환할 수 있어, 컨텍스트 길이를 확보하거나 멀티모달 기능을 활성화하는 작업이 훨씬 유연해집니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.