AI Briefing

Hugging Face, NVIDIA 추론 라이브러리 공개

Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code

·2023.12.05 09:00

Hugging Face가 NVIDIA 플랫폼에서 LLM 추론 속도를 최대 28배 높여주는 Optimum-NVIDIA 라이브러리를 출시했다.

Optimum-NVIDIA는 NVIDIA 플랫폼에서 LLM 추론 성능을 극적으로 가속화하는 새로운 라이브러리다.

NVIDIA TensorRT-LLM 소프트웨어와 새로운 FP8(float8) 형식을 활용하여, 기존 transformers 라이브러리 대비 **최대 28배의 처리량(Throughput)**과 **3.3배 빠른 첫 토큰 지연 시간(First Token Latency)**을 제공한다.

주요 특징은 다음과 같다:

  • 간편한 사용성: 기존 transformers 파이프라인에서 임포트 경로를 변경하는 것만으로 즉시 최적화된 성능을 활용할 수 있다.
  • FP8 양자화 지원: use_fp8=True 플래그를 통해 정확도 손실을 최소화하면서 더 큰 모델을 단일 GPU에서 더 빠르게 실행할 수 있다.
  • 하드웨어 최적화: NVIDIA Ada Lovelace 및 Hopper 아키텍처의 기능을 활용해 성능을 극대화한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.