ggml, Ternary Bonsai 지원 위한 Q2_0 양자화 추가
Ternary Bonsai 1.58-bit models - ggml: add Q2_0 quantization support (CPU) by khosravipasha · Pull Request #24448 · ggml-org/llama.cpp
·2026.07.08 23:45
llama.cpp의 ggml 라이브러리가 Ternary Bonsai 모델 지원을 위한 CPU용 Q2_0 양자화를 추가했습니다.
llama.cpp 프로젝트의 ggml 라이브러리에 Q2_0 양자화 지원이 추가되었습니다. 이번 업데이트는 주로 Ternary Bonsai 모델(1.7B, 4B, 8B) 및 향후 출시될 관련 모델들을 지원하기 위한 목적입니다.
주요 기술적 특징은 다음과 같습니다:
- 지원 범위: 현재 CPU 전용으로 구현되었으며, ARM NEON 및 일반 스칼라 폴백(generic scalar fallback)을 지원합니다.
- 양자화 패밀리 완성: 이번 추가로 Q1_0, Q2_0, Q4_0, Q8_0로 이어지는 양자화 제품군이 완성되었습니다.
- 향후 계획: x86, Metal, CUDA, Vulkan 백엔드에 대한 지원도 준비 중입니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.