LLM의 통계적 무손실 양자화 기술 SLQ 공개
[Paper] Statistically-Lossless Quantization of Large Language Models
·2026.07.25 03:06
LLM의 성능 저하를 최소화하면서 추론 속도를 높이는 통계적 무손실 양자화 기법 SLQ를 제안한다.
기존의 GPTQ나 AWQ 같은 양자화 방식은 압축 효율과 모델 성능 사이의 트레이드오프가 발생하지만, 본 논문은 **통계적 무손실(Statistically-Lossless)**이라는 새로운 개념을 통해 이를 해결한다.
연구팀은 세 가지 무손실 개념을 정의했다:
- Task-lossless: 제로샷 벤치마크 정확도를 자연적 샘플링 오차 범위 내에서 유지함.
- Distribution-lossless: 양자화된 모델의 다음 토큰 분포가 원본과 구별 불가능하도록 함 (EAR 지표 활용).
- Symmetric vs Asymmetric: 대칭 양자화가 비대칭 양자화보다 노이즈 분산을 높인다는 점을 증명하여 비대칭 양자화의 필요성을 입증함.
제안된 **SLQ(Layer-wise non-uniform method)**를 적용한 결과:
- Task-lossless: 파라미터당 3.3~4 bits 미만의 공격적인 압축에서도 성능 유지.
- Distribution-lossless: 평균 5~6 bits 수준에서 구현.
- Inference Speedup: 최적화된 커널 사용 시 FP16 대비 1.7~3.6배의 속도 향상 달성.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.