LLM의 통계적 무손실 양자화 기술 SLQ 공개
[Paper] Statistically-Lossless Quantization of Large Language Models
·2026.07.25 03:06
핵심 내용
LLM의 성능 저하를 최소화하면서 추론 속도를 높이는 통계적 무손실 양자화 기법 SLQ를 제안한다.
자세히 보기
기존의 GPTQ나 AWQ 같은 양자화 방식은 압축 효율과 모델 성능 사이의 트레이드오프가 발생하지만, 본 논문은 **통계적 무손실(Statistically-Lossless)**이라는 새로운 개념을 통해 이를 해결한다.
연구팀은 세 가지 무손실 개념을 정의했다:
- Task-lossless: 제로샷 벤치마크 정확도를 자연적 샘플링 오차 범위 내에서 유지함.
- Distribution-lossless: 양자화된 모델의 다음 토큰 분포가 원본과 구별 불가능하도록 함 (EAR 지표 활용).
- Symmetric vs Asymmetric: 대칭 양자화가 비대칭 양자화보다 노이즈 분산을 높인다는 점을 증명하여 비대칭 양자화의 필요성을 입증함.
제안된 **SLQ(Layer-wise non-uniform method)**를 적용한 결과:
- Task-lossless: 파라미터당 3.3~4 bits 미만의 공격적인 압축에서도 성능 유지.
- Distribution-lossless: 평균 5~6 bits 수준에서 구현.
- Inference Speedup: 최적화된 커널 사용 시 FP16 대비 1.7~3.6배의 속도 향상 달성.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.