Intel AutoRound 양자화 확장
GitHub - intel/auto-round: A SOTA quantization algorithm for high-accuracy low-bit LLM inference, seamlessly optimized for CPU/XPU/CUDA, with multi-datatype support and full compatibility with vLLM, SGLang, and Transformers.
AutoRound가 CPU/XPU/CUDA 지원과 저비트 양자화 포맷을 넓혔다.
AutoRound는 sign-gradient descent 기반 LLM/VLM 양자화 도구로, 2~4bit 저비트 추론을 목표로 한다. CPU(Xeon), Intel GPU(XPU), Gaudi HPU, CUDA를 지원하고, Transformers, vLLM, SGLang과 연동된다.
출력 포맷은 AutoRound, AutoAWQ, AutoGPTQ, GGUF, llm-compressor까지 넓어졌고, 10개 이상 VLM과 10개 이상 런타임 백엔드를 지원한다고 밝힌다. 최근 추가된 기능은 다음과 같다.
--scheme FP8_BLOCK --iters 0 --disable_opt_rtn기반 block-wise FP8- MTP layer quantization
enable_alg_ext기반 SignRoundV2와 개선된 INT2- MXFP4 / NVFP4, mixed-precision AutoScheme, enhanced GGUF
수치상으로는 7B 모델을 단일 GPU에서 약 10분에 양자화할 수 있고, mixed scheme 생성은 BF16 메모리의 1.1~1.5배 수준의 오버헤드로 동작한다. 기본 권장값은 W4A16에 auto-round, W2A16에 auto-round-best + enable_alg_ext다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.