AI Briefing

Samsung Labs, LittleBit-2 공개… LLM 가중치당 0.1비트 압축

·2026.10.08 22:29

핵심 내용

Samsung Labs가 Llama 3, Phi-4, Qwen3 등에서 가중치당 0.1비트까지 압축하는 LittleBit-2를 공개했다.

자세히 보기

Samsung Labs가 LLM을 1비트 미만으로 압축하는 LittleBit과 후속작 LittleBit-2의 공식 코드를 공개했습니다. 이 프로젝트는 각각 NeurIPS 2025와 ICML 2026에 채택되었으며, 잠재 요인 분해(latent factorization)를 통해 가중치 행렬을 이진화하면서도 추론 시 모델 구조는 그대로 유지합니다.

압축 방법론

핵심 기술은 밀집 가중치 행렬을 저랭크 잠재 요인으로 분해한 뒤 이진화하는 방식입니다. 경량 학습 스케일을 사용해 크기 정보를 복원하여 가중치당 1.0~0.1비트의 극단적 압축률을 달성합니다.

LittleBit-2는 Internal Latent Rotation with Joint Iterative Quantization (Joint-ITQ) 기법을 도입했습니다. 초기화 단계에서 SVD 기반 잠재 요인을 이진 하이퍼큐브와 정렬해 기하학적 불일치를 해결합니다. 이 기능은 --use_itq 플래그로 선택 적용할 수 있으며, 추론 오버헤드는 발생하지 않습니다.

지원 모델 및 사용법

코드베이스는 다음 파운데이션 모델을 광범위하게 지원합니다:

  • OPT
  • Llama 및 Llama 2/3
  • Phi-4
  • Qwen2.5 및 QwQ
  • Gemma 2 및 Gemma 3
  • Qwen3

구현체는 SmoothSign을 활용한 양자화 인식 학습(QAT)과 선택적 잔차 분해를 지원합니다. 단일 GPU 또는 DeepSpeed를 이용한 멀티 GPU 환경에서 모델을 학습할 수 있습니다. 퍼플렉시티(wikitext2, c4) 및 제로샷 작업(boolq, piqa, hellaswag 등)을 위한 평가 스크립트도 제공됩니다.

기술 요구 사항

프로젝트는 Python 3.12와 CUDA 12.4.1을 권장합니다. 논문 결과 재현을 위해서는 모델 내부 구조 변경을 피하기 위해 transformers 버전 4.51.x가 반드시 필요합니다. 저장소 라이선스는 CC BY-NC 4.0입니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.