BeeLlama.cpp v0.4.1 출시: KV 캐시 양자화 성능 개선
BeeLlama.cpp v0.4.1: KVarN, KV precision tail, q2_0-q3_1 KV cache, improved support. KLD benchmarks: tail 1024 makes kvarn5 and q6_0 match q8_0, for much less VRAM
·2026.07.27 01:28
llama.cpp의 포크 버전인 BeeLlama.cpp가 KV 캐시 양자화 효율을 높인 v0.4.1을 공개했다.
llama.cpp의 포크 프로젝트인 BeeLlama.cpp가 새로운 KV 캐시 양자화 기능을 포함한 v0.4.1 버전을 출시했다.
주요 업데이트 사항은 다음과 같다:
- KVarN (Variance-normalized KV-cache quantization): 비트당 정밀도를 높인 양자화 기술로, 기존 구현 대비 성능 저하를 최소화하면서 VRAM 사용량을 최적화했다.
- KV 캐시 정밀도 테일 (KV cache precision tail): 최근 토큰 일부를 BF16/F16으로 저장하고 나머지는 양자화하는 혼합 정밀도 방식이다. 이를 통해 모델이 중요한 작업 지시나 데이터를 놓치는 현상을 방지한다.
- 추가적인 표준 KV 캐시 타입: q6_0, q6_1 등 고정밀 타입과 q2_0, q3_1 등 저용량 타입을 추가하여 VRAM 용량과 정밀도 사이의 선택 폭을 넓혔다.
이번 업데이트는 특히 VRAM이 제한적인 환경에서 모델의 추론 성능과 정밀도를 동시에 확보하려는 사용자들에게 유용한 도구가 될 것으로 보인다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.