Intel AutoRound 양자화 확장
GitHub - intel/auto-round: A SOTA quantization algorithm for high-accuracy low-bit LLM inference, seamlessly optimized for CPU/XPU/CUDA, with multi-datatype support and full compatibility with vLLM, SGLang, and Transformers.
핵심 내용
AutoRound가 CPU/XPU/CUDA 지원과 저비트 양자화 포맷을 넓혔다.
자세히 보기
AutoRound는 sign-gradient descent 기반 LLM/VLM 양자화 도구로, 2~4bit 저비트 추론을 목표로 한다. CPU(Xeon), Intel GPU(XPU), Gaudi HPU, CUDA를 지원하고, Transformers, vLLM, SGLang과 연동된다.
출력 포맷은 AutoRound, AutoAWQ, AutoGPTQ, GGUF, llm-compressor까지 넓어졌고, 10개 이상 VLM과 10개 이상 런타임 백엔드를 지원한다고 밝힌다. 최근 추가된 기능은 다음과 같다.
--scheme FP8_BLOCK --iters 0 --disable_opt_rtn기반 block-wise FP8- MTP layer quantization
enable_alg_ext기반 SignRoundV2와 개선된 INT2- MXFP4 / NVFP4, mixed-precision AutoScheme, enhanced GGUF
수치상으로는 7B 모델을 단일 GPU에서 약 10분에 양자화할 수 있고, mixed scheme 생성은 BF16 메모리의 1.1~1.5배 수준의 오버헤드로 동작한다. 기본 권장값은 W4A16에 auto-round, W2A16에 auto-round-best + enable_alg_ext다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.