AI Briefing

추천Bonsai 27B 1-bit 양자화, 3.9GB로 iPhone 실행

Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB

·2026.07.17 22:08

PrismML이 Qwen 3.6-27B를 1-bit 양자화로 3.9GB로 압축한 Bonsai 27B 모델을 공개했다.

PrismML이 개발한 Bonsai 27B는 Qwen 3.6-27B 기반 27억 파라미터 모델을 1-bit 양자화로 극도로 압축한 모델이다. 원본 54GB에서 3.9GB로 축소되어 iPhone 15 Pro Max(8GB RAM)에서 로컬 실행이 가능하다.

양자화 기술: 모든 가중치를 단일 부호 비트로 인코딩하고, 128개 그룹마다 FP16 스케일을 공유하는 진정한 1-bit 양자화(Binary g128)를 적용했다. 임베딩, 어텐션/MLP 프로젝션, LM head까지 모두 이진화된 것이 특징이다.

성능 유지: 15개 벤치마크에서 평균 76.1(원본 FP16 85.1 대비 89.5% 유지). 수학 벤치마크는 91.7로 우수했으나, 지식/추론 능력은 73.4(원본 83.2)로 감소했다. 메모리는 4K 컨텍스트에서 5.2GB, 100K 컨텍스트에서 4-bit KV 캐시 사용 시 6.8GB이다.

Hugging Face에서 공개되었으며 Atomic Chat을 통해 iPhone에서 구동 가능하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.