AI Briefing

NVIDIA NIM, Hugging Face LLM 가속

Accelerate a World of LLMs on Hugging Face with NVIDIA NIM

·2025.07.22 03:01

핵심 내용

NVIDIA NIM이 Hugging Face의 10만 개 이상의 LLM을 신속하고 안정적으로 배포할 수 있도록 지원한다.

자세히 보기

NVIDIA가 **NVIDIA NIM(inference microservices)**을 통해 Hugging Face에 있는 10만 개 이상의 LLM을 신속하게 배포할 수 있는 기능을 공개했다. 개발자는 복잡한 설정 없이 단일 Docker 컨테이너를 사용하여 다양한 모델 아키텍처와 양자화 형식을 최적화된 상태로 배포할 수 있다.

NIM은 모델 배포 시 다음과 같은 자동화된 적응 단계를 수행한다:

  • 모델 분석: Hugging Face 모델, TensorRT-LLM 체크포인트 등을 자동 식별
  • 아키텍처 및 양자화 감지: Llama, Mistral 등의 구조와 FP16, FP8, INT4 등의 형식을 감지
  • 백엔드 선택: 분석 결과에 따라 NVIDIA TensorRT-LLM, vLLM, SGLang 중 최적의 백엔드 선택
  • 성능 설정: 사전 구성된 설정을 적용하여 수동 튜닝 없이 인퍼런스 서버 실행

지원되는 가중치 형식은 다음과 같다:

  • Hugging Face Transformers Checkpoints: .safetensors 파일을 직접 배포 가능
  • GGUF Checkpoints: 양자화된 GGUF 형식 지원
  • TensorRT-LLM Checkpoints 및 Engines: 최적화된 체크포인트 및 엔진 지원

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.