AI Briefing

Ternary Bonsai 소개: 1.58비트로 최고 수준의 지능

·2026.04.17 09:00

핵심 내용

PrismML이 1.58비트 ternary weights로 8B·4B·1.7B LLM인 Ternary Bonsai를 공개했다.

자세히 보기

Ternary Bonsai는 메모리 제약과 정확도 요구를 함께 맞추기 위해 설계된 1.58-bit 언어 모델 패밀리다. PrismML은 기존 1-bit Bonsai에서 한 단계 확장한 모델로, 더 큰 메모리 사용을 감수하는 대신 성능을 의미 있게 끌어올렸다고 밝혔다.

모델은 8B, 4B, 1.7B 세 가지 크기로 제공되며, **ternary weights {-1, 0, +1}**를 사용한다. 이를 통해 일반적인 16-bit 모델보다 메모리 사용량을 약 9배 줄이면서도, 각 파라미터 클래스에서 대부분의 경쟁 모델을 능가하는 성능을 목표로 한다.

핵심은 네트워크 전체가 1.58-bit representation을 일관되게 쓴다는 점이다. 임베딩, attention layer, MLP, LM head까지 모두 같은 표현을 사용하며, higher-precision escape hatch는 두지 않는다.

가중치는 그룹 단위 quantization으로 처리되고, 각 weight는 {-s, 0, +s} 중 하나로 제한된다. 이 세 상태는 **(-1, 0, +1)**로 인코딩되며, **128개 weight마다 공유하는 FP16 scale factor(s)**가 함께 사용된다.

성능 면에서 Ternary Bonsai 8B는 1-bit Bonsai 8B보다 평균 5점 더 높고, 메모리는 600MB만 더 쓴다. 평균 점수는 75.5로, 비교 대상 중에서는 Qwen3 8B(16.38 GB) 다음에 위치하면서도 나머지 모델들보다 앞섰고, MMLU Redux, MuSR, GSM8K, HumanEval+, IFEval, BFCLv3 등 여러 벤치마크에서 고르게 경쟁력을 보였다.

PrismML은 이 모델이 기존 1-bit Bonsai를 대체하는 것이 아니라, 더 큰 메모리를 허용할 수 있는 환경에서 선택할 수 있는 다른 트레이드오프라고 설명한다. 1.7B, 4B, 8B 버전은 배포 tiers에 따라 메모리, throughput, 품질을 유연하게 조정할 수 있게 해준다.

실사용 성능도 강조했다. M4 Pro에서 8B 모델은 82 toks/sec, iPhone 17 Pro Max에서는 27 toks/sec를 기록했고, 16-bit 동급 모델보다 대략 5배 빠르다고 소개했다. 에너지 효율은 0.105 mWh/tok(M4 Pro), 0.132 mWh/tok(iPhone 17 Pro Max) 수준으로, full-precision 대비 3~4배 개선됐다고 밝혔다.

모델은 MLX를 통해 Mac, iPhone, iPad에서 네이티브로 실행되며, 가중치는 Apache 2.0 License로 공개됐다. 자세한 학습·평가·벤치마크 방식은 whitepaper에 정리돼 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.