AI Briefing

Intel AutoRound 양자화 확장

GitHub - intel/auto-round: A SOTA quantization algorithm for high-accuracy low-bit LLM inference, seamlessly optimized for CPU/XPU/CUDA, with multi-datatype support and full compatibility with vLLM, SGLang, and Transformers.

·2026.05.01 23:03

핵심 내용

AutoRound가 CPU/XPU/CUDA 지원과 저비트 양자화 포맷을 넓혔다.

자세히 보기

AutoRound는 sign-gradient descent 기반 LLM/VLM 양자화 도구로, 2~4bit 저비트 추론을 목표로 한다. CPU(Xeon), Intel GPU(XPU), Gaudi HPU, CUDA를 지원하고, Transformers, vLLM, SGLang과 연동된다.

출력 포맷은 AutoRound, AutoAWQ, AutoGPTQ, GGUF, llm-compressor까지 넓어졌고, 10개 이상 VLM과 10개 이상 런타임 백엔드를 지원한다고 밝힌다. 최근 추가된 기능은 다음과 같다.

  • --scheme FP8_BLOCK --iters 0 --disable_opt_rtn 기반 block-wise FP8
  • MTP layer quantization
  • enable_alg_ext 기반 SignRoundV2와 개선된 INT2
  • MXFP4 / NVFP4, mixed-precision AutoScheme, enhanced GGUF

수치상으로는 7B 모델을 단일 GPU에서 약 10분에 양자화할 수 있고, mixed scheme 생성은 BF16 메모리의 1.1~1.5배 수준의 오버헤드로 동작한다. 기본 권장값은 W4A16에 auto-round, W2A16에 auto-round-best + enable_alg_ext다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.