AI Briefing

BeeLlama.cpp: llama.cpp 최적화

BeeLlama.cpp: advanced DFlash & TurboQuant with support of reasoning and vision. Qwen 3.6 27B Q5 with 200k context on 3090, 2-3x faster than baseline (peak 135 tps!)

·2026.05.10 01:05

llama.cpp의 성능을 극대화한 새로운 포크인 BeeLlama.cpp가 공개되었다.

BeeLlama.cpp는 GGUF 추론의 속도와 컨텍스트 용량을 극대화하기 위해 개발된 llama.cpp의 성능 중심 포크이다.

주요 기술적 특징은 다음과 같다:

  • DFlash Speculative Decoding: 타겟 모델의 은닉 상태(hidden states)를 링 버퍼에 저장하고 드래프터(drafter)가 이를 참조하여 초고속 추론을 수행한다.
  • TurboQuant / TCQ KV-cache Compression: 4배에서 최대 7.5배의 KV 캐시 압축을 지원하여 VRAM 효율을 높인다.
  • 기타 기능: 적응형 드래프트 제어, 추론 루프 보호, 멀티모달(Vision) 지원을 포함한다.

RTX 3090 환경에서 Qwen 3.6 27B Q5 모델을 사용할 경우, 200k 컨텍스트를 유지하면서도 기존 대비 2~3배 빠른 속도(최대 135 tps)를 구현할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.