AI Briefing

Ternary LLM 가중치 압축 한계 돌파: BITCOS 기법으로 1.485 bits/weight 달성

·2026.09.17 05:59

핵심 내용

Intel 연구진이 Ternary LLM의 가중치 분포를 분석해 기존 한계를 넘는 BITCOS 압축 기법을 제안했다.

자세히 보기

Intel 연구진이 Ternary LLM의 가중치 분포 특성을 활용해 기존 정보 이론적 한계를 극복하는 새로운 압축 기법 BITCOS를 제안했다. 기존 실무 배포 포맷인 five-trit packing은 group size의 power-of-two 특성으로 인해 1.625 bits/weight로 반올림되는 한계가 있었으나, BITCOS는 가중치 분포에 적응하는 레이아웃으로 이를 개선했다.

핵심 발견 및 기법

연구진은 29개의 Ternary LLM 모델을 측정하여 zero가 전체 가중치의 최대 **51.5%**를 차지하는 사실을 발견했다. 이를 바탕으로 dense presence bitmap과 compacted presence bitmap을 결합한 BITCOS 기법을 도입했다. 이 기법은 zero density(z)에 따라 2 - z bits/weight의 비용을 가지며, 테스트된 모델 중 26개에서 기존 방식보다 더 컴팩트한 압축률을 보였다.

하드웨어 효율성 및 성능

BITCOS는 AVX-512 및 Intel Xe2 GPU 등 하드웨어에 최적화된 언패킹 시퀀스를 제공한다. 측정 결과, 실제 Ternary 모델의 zero density 기준 production kernel 대비 최대 1.28배의 연산 속도 향상을 보였으며, End-to-end 추론 테스트에서는 CPU에서 최대 1.18배, GPU에서 최대 1.27배의 decode throughput 향상을 확인했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.