AI Briefing

PrismML, FP16 성능 98.2% 유지하는 삼진 양자화 모델 'Ternary Bonsai 2 27B' 공개

Ternary Bonsai 2 27B, 5.93GB로 줄이고도 FP16 성능의 98.2%를 지킨 삼진 모델 (feat. PrismML)

·2026.09.19 11:00

핵심 내용

PrismML이 27B 멀티모달 LLM을 삼진 양자화해 FP16 대비 98.2%의 성능을 유지하는 'Ternary Bonsai 2 27B'를 공개했다.

1 / 4

자세히 보기

PrismML이 기존 FP16 가중치를 {-1, 0, +1} 삼진 값으로 변환한 Ternary Bonsai 2 27B를 공개했다. 이 모델은 원본 Qwen3.8-27B FP16 모델 대비 20종 벤치마크 평균 98.2%의 성능을 유지하며, Apache License 2.0으로 배포된다.

핵심 기술 및 성능

  • 압축 효율: Hadamard 회전 기저를 적용해 이상치 분산을 최소화하고, PTQ1_0 패킹 방식으로 가중치당 1.76비트를 달성했다. 백서 기준 파일 크기는 53.80GB에서 5.93GB로 약 9.1배 축소되었다.
  • 성능 유지: xhigh 추론 강도 기준 원본 모델 대비 성능 손실이 최소화되었다. 수학 및 코딩 영역에서 손실이 적으며, 지시 따르기 능력은 오히려 1.41점 상승했다. 다만 장기 호흡 에이전트 작업(Terminal-Bench 등)에서는 유지율이 약 75%로 떨어지는 한계가 있다.
  • 하드웨어 최적화: Apple Silicon(M5 Pro)에서 초당 27.7토큰의 디코딩 속도를 기록했으며, GPU 전력 소모는 27.0W 수준이다.

배포 및 제약 사항

  • 실행 환경: 상류 llama.cpp는 아직 지원되지 않아 PrismML 포크가 필요하다. MLX 및 WebGPU 데모도 제공된다.
  • 데이터 불일치: 백서와 Hugging Face 모델 카드 간 파일 크기 및 벤치마크 점수에 차이가 존재한다. 백서는 5.93GB/83.9점, 모델 카드는 5.95GB/84.78점을 제시한다. 실제 업로드된 파일은 모델 카드 수치와 일치한다.
  • 추론 강도 영향: 98.2%의 유지율은 xhigh 추론 강도에서의 값이며, medium 강도에서는 유지율이 약 96.0%로 내려간다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.