AI Briefing

Bonsai 3진법 모델, 노트북에서 27B급 추론 실행

Now you can grow Bonsai on your potato

·2026.10.11 21:58

핵심 내용

Bonsai 3진법 모델이 FP16 지능의 98.2%를 유지하며 27B급 추론을 노트북에서 실행한다.

자세히 보기

Bonsai가 일반 노트북과 단일 GPU에서 27B급 추론을 가능하게 하는 3진법(ternary) 트랜스포머 아키텍처를 공개했다. GPU 자원이 부족한 사용자를 위한 솔루션으로, FP16 대비 크기를 약 9.3배 줄여 약 5.9 GB로 압축하면서도 FP16 지능의 **98.2%**를 유지한다.

성능 및 벤치마크

일반적인 저비트 표현이 붕괴하는 4비트 미만 구간에서도 추론 능력을 강하게 유지한다:

  • 평균 점수: 14개 사고 모드 벤치마크에서 84.78점을 기록, 유사한 용량의 기존 IQ2_XXS 빌드(72.59)를 크게 앞선다.
  • 수학: 96.57점으로 완전 정밀도와 0.5점 이내 차이를 보인다.
  • 코딩: 89.42점으로 기준선과 동등한 수준이다.
  • 에이전트 도구 호출: 74.92점.
  • 속도: Apple M5 Max 노트북에서 초당 약 47개 토큰 처리.

기술 구현

Bonsai는 임베딩, 어텐션 투영, MLP 투영, LM 헤드 전반에 걸쳐 엔드투엔드 3진법 언어 가중치를 사용하며, 고정밀 우회 경로 없이 가중치당 1.72비트를 달성한다. 비전 타워는 Q8_0 mmproj 팩으로 별도 배포된다.

모델은 Qwen3.8-27B 하이브리드 어텐션 백본(약 75% 선형 어텐션)을 기반으로 하며, 기기에서 262K 토큰 컨텍스트를 지원한다. llama.cpp(CUDA, Metal)용 GGUF 팩킹 두 가지를 제공한다:

  • PTQ1_0: 가중치당 1.75비트로 3진법을 밀집 포장(5.95 GB).
  • PQ2_0: 각 3진법을 2비트 슬롯에 저장, 가중치당 2.13비트(7.21 GB).

포장된 가중치는 커스텀 커널이 직접 사용하며 FP16으로 다시 확장되지 않는다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.