TGI, Intel Gaudi 네이티브 지원 시작
🚀 Accelerating LLM Inference with TGI on Intel Gaudi
·2025.03.28 09:00
HuggingFace의 LLM 서빙 솔루션 TGI가 Intel Gaudi 하드웨어를 네이티브로 지원합니다.
HuggingFace의 LLM 서빙 솔루션인 **Text Generation Inference (TGI)**에 Intel Gaudi 하드웨어 지원이 네이티브로 통합되었습니다. 기존에는 별도의 포크(fork)를 통해 지원했으나, 이제 TGI의 새로운 멀티 백엔드 아키텍처를 통해 메인 코드베이스에서 직접 지원됩니다.
지원되는 하드웨어는 Gaudi1, Gaudi2, Gaudi3 전 라인업을 포함하며, AWS, Intel Tiber AI Cloud, IBM Cloud 및 주요 OEM(Dell, HP, Supermicro)을 통해 이용할 수 있습니다.
주요 특징 및 이점:
- 하드웨어 다양성 및 비용 효율성: GPU 외의 배포 옵션을 제공하며, 특정 워크로드에서 높은 가성비를 제공합니다.
- 생산 환경 최적화: 다이내믹 배칭, 스트리밍 응답, 멀티 카드 추론(sharding), FP8 정밀도 등을 지원합니다.
- 모델 지원: Llama 3.1/3.3, Mistral, Mixtral, Qwen2, Gemma 등 주요 모델에 대해 최적화된 성능을 제공합니다.
향후 DeepSeek-r1/v3와 같은 최신 모델로 지원 범위를 확대할 계획입니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.