AI Briefing

LittleBit-2: 잠재 기하 정렬로 1비트 미만 LLM의 스펙트럼 에너지 이득 극대화

·2026.08.04 08:39

LittleBit-2가 잠재 기하 정렬로 1비트 미만 LLM의 양자화 성능을 높였다.

LittleBit-2는 1비트 미만 영역에서 대규모 언어 모델(LLM)의 압축 효율과 성능을 동시에 높이는 방법이다. 70B 모델은 FP16에서 약 140GB의 VRAM이 필요하고, 완전한 1비트 모델도 약 15GB를 요구해 엣지 및 소비자 기기 배포에 부담이 된다.

삼성의 기존 LittleBit은 가중치 행렬을 저랭크 이진 잠재 요인으로 분해해 최대 0.1 bits per parameter(bpp)까지 압축했다. 하지만 1bpp 구간에서는 OneBit보다 성능이 낮았으며, Llama-2 7B 기준 perplexity가 9.08로 OneBit의 8.36에 미치지 못했다.

원인은 표준 SVD로 초기화한 잠재 요인의 기하 구조 불일치였다. 특이 벡터가 일부 좌표에 집중된 ‘spiky’ 구조를 가지면서 이진 양자화 대상인 바이너리 하이퍼큐브와 맞지 않았고, 0에 가까운 값은 작은 perturbation에도 부호가 쉽게 뒤집혔다. 또한 일부 outlier 때문에 공유 부동소수점 스케일이 전체 값의 범위를 과도하게 추정했다.

LittleBit-2는 다음 두 기법으로 이 문제를 해결한다.

  • Internal Latent Rotation: 잠재 요인을 회전해 바이너리 하이퍼큐브의 대각선 방향에 맞춘다.
  • Joint Iterative Quantization(Joint-ITQ): 잠재 요인들을 공동으로 반복 양자화해 이진 표현에 적합한 분포를 만든다.

이 과정은 추론 단계에 추가 비용을 발생시키지 않는다. Llama-2와 Llama-3에서 1~0.1bpp 전 구간의 성능을 개선했으며, 주요 1비트 기준선과 대등하거나 이를 넘어서는 결과를 기록해 해당 영역의 새로운 최첨단 성능을 제시했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.