Bonsai 3진법 모델, 노트북에서 27B급 추론 실행
Now you can grow Bonsai on your potato
·2026.10.11 21:58
핵심 내용
Bonsai 3진법 모델이 FP16 지능의 98.2%를 유지하며 27B급 추론을 노트북에서 실행한다.
자세히 보기
Bonsai가 일반 노트북과 단일 GPU에서 27B급 추론을 가능하게 하는 3진법(ternary) 트랜스포머 아키텍처를 공개했다. GPU 자원이 부족한 사용자를 위한 솔루션으로, FP16 대비 크기를 약 9.3배 줄여 약 5.9 GB로 압축하면서도 FP16 지능의 **98.2%**를 유지한다.
성능 및 벤치마크
일반적인 저비트 표현이 붕괴하는 4비트 미만 구간에서도 추론 능력을 강하게 유지한다:
- 평균 점수: 14개 사고 모드 벤치마크에서 84.78점을 기록, 유사한 용량의 기존 IQ2_XXS 빌드(72.59)를 크게 앞선다.
- 수학: 96.57점으로 완전 정밀도와 0.5점 이내 차이를 보인다.
- 코딩: 89.42점으로 기준선과 동등한 수준이다.
- 에이전트 도구 호출: 74.92점.
- 속도: Apple M5 Max 노트북에서 초당 약 47개 토큰 처리.
기술 구현
Bonsai는 임베딩, 어텐션 투영, MLP 투영, LM 헤드 전반에 걸쳐 엔드투엔드 3진법 언어 가중치를 사용하며, 고정밀 우회 경로 없이 가중치당 1.72비트를 달성한다. 비전 타워는 Q8_0 mmproj 팩으로 별도 배포된다.
모델은 Qwen3.8-27B 하이브리드 어텐션 백본(약 75% 선형 어텐션)을 기반으로 하며, 기기에서 262K 토큰 컨텍스트를 지원한다. llama.cpp(CUDA, Metal)용 GGUF 팩킹 두 가지를 제공한다:
- PTQ1_0: 가중치당 1.75비트로 3진법을 밀집 포장(5.95 GB).
- PQ2_0: 각 3진법을 2비트 슬롯에 저장, 가중치당 2.13비트(7.21 GB).
포장된 가중치는 커스텀 커널이 직접 사용하며 FP16으로 다시 확장되지 않는다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.