BeeLlama.cpp v0.4.0 출시
BeeLlama.cpp v0.4.0: KVarN, KV precision tail, q2_0-q3_1 KV cache, upstream rebase
·2026.07.20 03:06
KV 캐시 양자화 성능을 개선한 llama.cpp 포크 버전인 BeeLlama v0.4.0이 공개되었습니다.
llama.cpp의 포크 프로젝트인 BeeLlama.cpp v0.4.0이 업데이트되었습니다. 이번 버전은 기존의 DFlash 및 TurboQuant 기능을 제거하고, 최신 llama.cpp 코드베이스를 기반으로 KV 캐시(KV Cache) 관련 핵심 기능에 집중했습니다.
주요 업데이트 사항은 다음과 같습니다:
- KVarN(Variance-normalized KV-cache quantization): 기존 구현의 성능 저하와 VRAM 스파이크 문제를 해결하여, 동일 비트 너비에서 기존 양자화 방식보다 높은 정밀도를 제공합니다.
- KV 캐시 정밀도 개선: KV precision tail 기술을 통해 정밀도를 최적화했습니다.
- 다양한 양자화 타입 지원: q2_0-q3_1, q6_0, q6_1 등 추가적인 표준 KV 캐시 타입을 지원합니다.
다만, SWA(Sliding Window Attention) 아키텍처(Gemma 등)의 경우 VRAM 사용량 관련 이슈로 인해 아직 프로덕션 환경에 적용하기에는 준비 단계에 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.