NVIDIA NIM, Hugging Face LLM 가속
Accelerate a World of LLMs on Hugging Face with NVIDIA NIM
·2025.07.22 03:01
NVIDIA NIM이 Hugging Face의 10만 개 이상의 LLM을 신속하고 안정적으로 배포할 수 있도록 지원한다.
NVIDIA가 **NVIDIA NIM(inference microservices)**을 통해 Hugging Face에 있는 10만 개 이상의 LLM을 신속하게 배포할 수 있는 기능을 공개했다. 개발자는 복잡한 설정 없이 단일 Docker 컨테이너를 사용하여 다양한 모델 아키텍처와 양자화 형식을 최적화된 상태로 배포할 수 있다.
NIM은 모델 배포 시 다음과 같은 자동화된 적응 단계를 수행한다:
- 모델 분석: Hugging Face 모델, TensorRT-LLM 체크포인트 등을 자동 식별
- 아키텍처 및 양자화 감지: Llama, Mistral 등의 구조와 FP16, FP8, INT4 등의 형식을 감지
- 백엔드 선택: 분석 결과에 따라 NVIDIA TensorRT-LLM, vLLM, SGLang 중 최적의 백엔드 선택
- 성능 설정: 사전 구성된 설정을 적용하여 수동 튜닝 없이 인퍼런스 서버 실행
지원되는 가중치 형식은 다음과 같다:
- Hugging Face Transformers Checkpoints:
.safetensors파일을 직접 배포 가능 - GGUF Checkpoints: 양자화된 GGUF 형식 지원
- TensorRT-LLM Checkpoints 및 Engines: 최적화된 체크포인트 및 엔진 지원
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.