AI Briefing

BeeLlama.cpp v0.4.0 출시

BeeLlama.cpp v0.4.0: KVarN, KV precision tail, q2_0-q3_1 KV cache, upstream rebase

·2026.07.20 03:06

핵심 내용

KV 캐시 양자화 성능을 개선한 llama.cpp 포크 버전인 BeeLlama v0.4.0이 공개되었습니다.

자세히 보기

llama.cpp의 포크 프로젝트인 BeeLlama.cpp v0.4.0이 업데이트되었습니다. 이번 버전은 기존의 DFlash 및 TurboQuant 기능을 제거하고, 최신 llama.cpp 코드베이스를 기반으로 KV 캐시(KV Cache) 관련 핵심 기능에 집중했습니다.

주요 업데이트 사항은 다음과 같습니다:

  • KVarN(Variance-normalized KV-cache quantization): 기존 구현의 성능 저하와 VRAM 스파이크 문제를 해결하여, 동일 비트 너비에서 기존 양자화 방식보다 높은 정밀도를 제공합니다.
  • KV 캐시 정밀도 개선: KV precision tail 기술을 통해 정밀도를 최적화했습니다.
  • 다양한 양자화 타입 지원: q2_0-q3_1, q6_0, q6_1 등 추가적인 표준 KV 캐시 타입을 지원합니다.

다만, SWA(Sliding Window Attention) 아키텍처(Gemma 등)의 경우 VRAM 사용량 관련 이슈로 인해 아직 프로덕션 환경에 적용하기에는 준비 단계에 있습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.