AI Briefing

ParoQuant, 추론용 4비트 양자화

ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference

·2026.05.07 11:07

ICLR 2026 ParoQuant가 reasoning LLM용 4비트 양자화법과 코드·모델을 공개했다.

ParoQuant는 ICLR 2026 논문으로, reasoning LLM의 INT4 양자화에서 누적되는 오차를 줄이기 위해 scaled pairwise rotation을 제안한다.

  • 기존 full rotation 대신, 채널 쌍만 다루는 pairwise(Givens) rotations를 선택적으로 남긴다.
  • 채널별 scaling과 8개의 독립 회전 세트를 결합해 GPU에서 병렬 실행한다.
  • 전체 변환은 단일 fused CUDA kernel에 들어가며, AWQ 대비 오버헤드는 10% 미만으로 제시됐다.

Qwen3-4B 4bit 실험에서는 MMLU 70.1, GPQA 53.7, AIME24 73.3, AIME25 63.3, 평균 65.1을 기록해 AWQ와 EfficientQAT를 앞섰다. reasoning 벤치마크에서는 AWQ 대비 평균 2.4% 정확도 개선을 내세우며, 다른 테스트 모델도 1.7B~70B 범위에서 비슷한 경향을 보였다.

NVIDIA GPU(vLLM, Transformers)와 Apple Silicon(MLX)을 지원하고, OpenAI-compatible API server와 tool-calling agent도 제공한다. Hugging Face 컬렉션에는 Qwen3.5, Qwen3.6, Gemma 4, Llama 계열 파생 모델이 올라와 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.