AI Briefing

Hugging Face, Optimum 추론 가속화 지원

Accelerated Inference with Optimum and Transformers Pipelines

·2022.05.10 09:00

Hugging Face가 Transformers 모델의 추론 성능을 최적화하는 Optimum 라이브러리의 기능을 업데이트했다.

Hugging Face의 오픈소스 라이브러리인 Optimum이 Transformers 파이프라인에 대한 추론 지원을 추가했다. 이를 통해 사용자는 기존 Transformers API와 호환되는 방식으로 ONNX Runtime과 같은 가속 런타임을 활용하여 모델 효율성을 극대화할 수 있다.

주요 기능 및 특징은 다음과 같다:

  • API 호환성: AutoModelForXxxORTModelForXxx로 교체하는 것만으로 최적화된 모델 사용 가능
  • Hugging Face Hub 통합: 최적화된 체크포인트를 허브에서 직접 가져오거나 업로드 가능
  • 최적화 도구 제공: ORTQuantizerORTOptimizer를 통한 모델 양자화와 그래프 최적화 지원

이 업데이트는 BERT 등 Transformer 기반 모델을 대규모 프로덕션 환경에 배포하려는 개발자들에게 모델 서빙 속도와 효율성을 높일 수 있는 도구를 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.