AI Briefing

NVIDIA NIM, Hugging Face LLM 가속

Accelerate a World of LLMs on Hugging Face with NVIDIA NIM

·2025.07.22 03:01

NVIDIA NIM이 Hugging Face의 10만 개 이상의 LLM을 신속하고 안정적으로 배포할 수 있도록 지원한다.

NVIDIA가 **NVIDIA NIM(inference microservices)**을 통해 Hugging Face에 있는 10만 개 이상의 LLM을 신속하게 배포할 수 있는 기능을 공개했다. 개발자는 복잡한 설정 없이 단일 Docker 컨테이너를 사용하여 다양한 모델 아키텍처와 양자화 형식을 최적화된 상태로 배포할 수 있다.

NIM은 모델 배포 시 다음과 같은 자동화된 적응 단계를 수행한다:

  • 모델 분석: Hugging Face 모델, TensorRT-LLM 체크포인트 등을 자동 식별
  • 아키텍처 및 양자화 감지: Llama, Mistral 등의 구조와 FP16, FP8, INT4 등의 형식을 감지
  • 백엔드 선택: 분석 결과에 따라 NVIDIA TensorRT-LLM, vLLM, SGLang 중 최적의 백엔드 선택
  • 성능 설정: 사전 구성된 설정을 적용하여 수동 튜닝 없이 인퍼런스 서버 실행

지원되는 가중치 형식은 다음과 같다:

  • Hugging Face Transformers Checkpoints: .safetensors 파일을 직접 배포 가능
  • GGUF Checkpoints: 양자화된 GGUF 형식 지원
  • TensorRT-LLM Checkpoints 및 Engines: 최적화된 체크포인트 및 엔진 지원

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.