2비트로 40% 절감
TurboQuant-H: A Technique For Quantizing Models Like Gemma 4 E2B/E4B to 2-bit
핵심 내용
Hadamard rotation과 Lloyd-Max codebook으로 Gemma 4 E2B의 PLI를 2비트로 압축했다.
자세히 보기
Gemma 4 E2B의 per-layer input(PLI) embedding이 전체 가중치의 **60.6%**를 차지해 저장 공간을 크게 잡아먹는다.
TurboQuant-H는 TurboQuant의 아이디어를 offline 가중치 양자화에 맞게 단순화해, random orthogonal rotation 대신 Hadamard rotation을 쓰고 per-group Lloyd-Max codebook으로 2비트 양자화를 수행한다. QJL correction은 제거했다.
핵심 설정은 다음과 같다.
- vocab size: 262,144
- embedding dim: 8,190
- group size: 128
- codebook: group당 4 centroids
- codebook overhead: 0.125 bits/element
- effective bit rate: 2.125 bits/element
결과적으로 PLI 가중치는 2,496 MB → 624 MB로 줄었고, 전체 모델 저장 용량은 4,790 MB → 2,918 MB로 감소했다. 퍼플렉서티는 1.8547 → 1.9111로 0.06만 증가했으며, 측정된 속도 저하는 없었다.
평가 조건은 128개 self-generated WildChat-1M completion, 24,438 scored tokens였고, HF BF16 기준 1.2892 PPL과 비교했다. 또한 group size 실험에서는 128이 오버헤드와 품질의 균형점으로 제시됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.