AI Briefing

2비트로 40% 절감

TurboQuant-H: A Technique For Quantizing Models Like Gemma 4 E2B/E4B to 2-bit

·2026.04.22 12:04

Hadamard rotation과 Lloyd-Max codebook으로 Gemma 4 E2B의 PLI를 2비트로 압축했다.

Gemma 4 E2B의 per-layer input(PLI) embedding이 전체 가중치의 **60.6%**를 차지해 저장 공간을 크게 잡아먹는다.

TurboQuant-H는 TurboQuant의 아이디어를 offline 가중치 양자화에 맞게 단순화해, random orthogonal rotation 대신 Hadamard rotation을 쓰고 per-group Lloyd-Max codebook으로 2비트 양자화를 수행한다. QJL correction은 제거했다.

핵심 설정은 다음과 같다.

  • vocab size: 262,144
  • embedding dim: 8,190
  • group size: 128
  • codebook: group당 4 centroids
  • codebook overhead: 0.125 bits/element
  • effective bit rate: 2.125 bits/element

결과적으로 PLI 가중치는 2,496 MB → 624 MB로 줄었고, 전체 모델 저장 용량은 4,790 MB → 2,918 MB로 감소했다. 퍼플렉서티는 1.8547 → 1.91110.06만 증가했으며, 측정된 속도 저하는 없었다.

평가 조건은 128개 self-generated WildChat-1M completion, 24,438 scored tokens였고, HF BF16 기준 1.2892 PPL과 비교했다. 또한 group size 실험에서는 128이 오버헤드와 품질의 균형점으로 제시됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.