TGI, AWS Inferentia2 지원
Hugging Face Text Generation Inference available for AWS Inferentia2
·2024.02.01 09:00
Hugging Face의 LLM 서빙 솔루션인 TGI가 AWS Inferentia2 및 Amazon SageMaker에서 정식 지원된다.
Hugging Face의 **Text Generation Inference (TGI)**가 AWS Inferentia2 및 Amazon SageMaker에서 정식 출시(General Availability)되었다.
TGI는 Llama, Mistral 등 주요 오픈 소스 LLM을 대규모 프로덕션 환경에서 배포하고 서빙하기 위해 설계된 솔루션이다. Tensor Parallelism과 Continuous Batching 기술을 통해 고성능 텍스트 생성을 지원하며, Grammarly, Uber 등 글로벌 기업들이 이미 사용 중이다.
이번 통합을 통해 AWS 고객은 GPU의 대안으로 Inferentia2를 활용하여 LLM 애플리케이션을 더욱 효율적이고 확장 가능하게 구축할 수 있다.
주요 특징:
- Amazon SageMaker 통합: 모델 배포 및 유지보수의 용이성 확보
- 고성능 서빙: HuggingChat 및 Serverless Endpoints와 동일한 기술 스택 활용
- 모델 지원: Llama, Mistral 등 다양한 오픈 LLM 지원
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.