AI Briefing

LLM의 통계적 무손실 양자화 기술 SLQ 공개

[Paper] Statistically-Lossless Quantization of Large Language Models

·2026.07.25 03:06

핵심 내용

LLM의 성능 저하를 최소화하면서 추론 속도를 높이는 통계적 무손실 양자화 기법 SLQ를 제안한다.

자세히 보기

기존의 GPTQ나 AWQ 같은 양자화 방식은 압축 효율과 모델 성능 사이의 트레이드오프가 발생하지만, 본 논문은 **통계적 무손실(Statistically-Lossless)**이라는 새로운 개념을 통해 이를 해결한다.

연구팀은 세 가지 무손실 개념을 정의했다:

  • Task-lossless: 제로샷 벤치마크 정확도를 자연적 샘플링 오차 범위 내에서 유지함.
  • Distribution-lossless: 양자화된 모델의 다음 토큰 분포가 원본과 구별 불가능하도록 함 (EAR 지표 활용).
  • Symmetric vs Asymmetric: 대칭 양자화가 비대칭 양자화보다 노이즈 분산을 높인다는 점을 증명하여 비대칭 양자화의 필요성을 입증함.

제안된 **SLQ(Layer-wise non-uniform method)**를 적용한 결과:

  • Task-lossless: 파라미터당 3.3~4 bits 미만의 공격적인 압축에서도 성능 유지.
  • Distribution-lossless: 평균 5~6 bits 수준에서 구현.
  • Inference Speedup: 최적화된 커널 사용 시 FP16 대비 1.7~3.6배의 속도 향상 달성.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.