2비트로 40% 절감
TurboQuant-H: A Technique For Quantizing Models Like Gemma 4 E2B/E4B to 2-bit
Hadamard rotation과 Lloyd-Max codebook으로 Gemma 4 E2B의 PLI를 2비트로 압축했다.
Gemma 4 E2B의 per-layer input(PLI) embedding이 전체 가중치의 **60.6%**를 차지해 저장 공간을 크게 잡아먹는다.
TurboQuant-H는 TurboQuant의 아이디어를 offline 가중치 양자화에 맞게 단순화해, random orthogonal rotation 대신 Hadamard rotation을 쓰고 per-group Lloyd-Max codebook으로 2비트 양자화를 수행한다. QJL correction은 제거했다.
핵심 설정은 다음과 같다.
- vocab size: 262,144
- embedding dim: 8,190
- group size: 128
- codebook: group당 4 centroids
- codebook overhead: 0.125 bits/element
- effective bit rate: 2.125 bits/element
결과적으로 PLI 가중치는 2,496 MB → 624 MB로 줄었고, 전체 모델 저장 용량은 4,790 MB → 2,918 MB로 감소했다. 퍼플렉서티는 1.8547 → 1.9111로 0.06만 증가했으며, 측정된 속도 저하는 없었다.
평가 조건은 128개 self-generated WildChat-1M completion, 24,438 scored tokens였고, HF BF16 기준 1.2892 PPL과 비교했다. 또한 group size 실험에서는 128이 오버헤드와 품질의 균형점으로 제시됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.