AI Briefing

Hugging Face, 양자화 백엔드 'Quanto' 공개

Quanto: a PyTorch quantization backend for Optimum

·2024.03.18 09:00

Hugging Face가 Optimum 라이브러리를 위한 범용 PyTorch 양자화 백엔드인 Quanto를 출시했다.

양자화는 가중치와 활성화를 int8이나 float8 같은 저정밀도 데이터 타입으로 표현하여 모델의 메모리 사용량과 연산 비용을 줄이는 기술입니다.

Hugging Face는 기존 양자화 라이브러리들의 호환성 및 장치 제한 문제를 해결하기 위해, Optimum을 위한 새로운 PyTorch 양자화 백엔드인 Quanto를 공개했습니다.

Quanto의 주요 특징:

  • 범용성: Eager mode를 지원하여 추적 불가능한(non-traceable) 모델에서도 작동하며, CUDA 및 MPS 등 모든 장치에서 사용 가능합니다.
  • 자동화: 양자화/역양자화 스텁(stub) 및 양자화 모듈을 자동으로 삽입합니다.
  • 다양한 정밀도 지원: int2, int4, int8, float8 가중치와 int8, float8 활성화를 지원합니다.
  • 성능 최적화: CUDA 장치에서 가속화된 행렬 곱셈(int8-int8, fp16-int4, bf16-int8, bf16-int4)을 제공합니다.
  • 유연한 워크플로우: 동적(dynamic) 및 정적(static) 양자화로 이어지는 원활한 과정을 제공하며, Safetensors와 호환됩니다.

사용자는 모델을 양자화한 후, 필요에 따라 Calibration(활성화 범위 기록)이나 **Quantization-Aware-Training(QAT)**을 통해 모델 성능 저하를 보완할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.