TGI, 멀티 추론 백엔드 지원
Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference
·2025.01.16 09:00
Hugging Face의 TGI가 vLLM, TensorRT-LLM 등 다양한 추론 엔진을 지원하는 멀티 백엔드 아키텍처를 도입한다.
Hugging Face가 기존의 Text Generation Inference(TGI)에 멀티 백엔드(Multi-backend) 지원 기능을 도입한다.
이 새로운 아키텍처는 TGI를 단일 통합 프론트엔드 레이어로 활용하여, 사용자가 하드웨어 및 성능 요구사항에 따라 vLLM, TensorRT-LLM, llama.cpp 등 다양한 추론 엔진을 유연하게 선택하고 전환할 수 있게 한다.
주요 로드맵 및 협업 계획은 다음과 같다:
- NVIDIA TensorRT-LLM: NVIDIA GPU 최적화 성능 제공을 위한 협업.
- llama.cpp: CPU 기반 배포(Intel, AMD, ARM)를 위한 지원 확대.
- vLLM: 2025년 1분기 내 TGI 백엔드로 통합 예정.
- AWS Neuron & Google TPU: AWS Inferentia/Trainium 및 Google TPU에 대한 네이티브 지원 강화.
이 기능은 향후 Hugging Face Inference Endpoints에서도 직접 사용할 수 있게 되어, 다양한 하드웨어에서 최적의 성능과 신뢰성을 갖춘 모델 배포가 가능해질 전망이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.