AI Briefing

Hugging Face, Optimum 추론 가속화 지원

Accelerated Inference with Optimum and Transformers Pipelines

·2022.05.10 09:00

핵심 내용

Hugging Face가 Transformers 모델의 추론 성능을 최적화하는 Optimum 라이브러리의 기능을 업데이트했다.

자세히 보기

Hugging Face의 오픈소스 라이브러리인 Optimum이 Transformers 파이프라인에 대한 추론 지원을 추가했다. 이를 통해 사용자는 기존 Transformers API와 호환되는 방식으로 ONNX Runtime과 같은 가속 런타임을 활용하여 모델 효율성을 극대화할 수 있다.

주요 기능 및 특징은 다음과 같다:

  • API 호환성: AutoModelForXxx를 ORTModelForXxx로 교체하는 것만으로 최적화된 모델 사용 가능
  • Hugging Face Hub 통합: 최적화된 체크포인트를 허브에서 직접 가져오거나 업로드 가능
  • 최적화 도구 제공: ORTQuantizer 및 ORTOptimizer를 통한 모델 양자화와 그래프 최적화 지원

이 업데이트는 BERT 등 Transformer 기반 모델을 대규모 프로덕션 환경에 배포하려는 개발자들에게 모델 서빙 속도와 효율성을 높일 수 있는 도구를 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.