SageMaker용 LLM 추론 컨테이너 공개
Introducing the Hugging Face LLM Inference Container for Amazon SageMaker
·2023.05.31 09:00
Hugging Face가 TGI 기반의 Amazon SageMaker 전용 LLM 추론 컨테이너를 출시했다.
Hugging Face가 Amazon SageMaker에서 오픈소스 LLM을 쉽고 안전하게 배포할 수 있는 **LLM Inference DLC(Deep Learning Container)**를 출시했다.
이 컨테이너는 **Text Generation Inference (TGI)**를 기반으로 하며, 고성능 텍스트 생성을 위해 다음과 같은 최적화 기술을 지원한다:
- Tensor Parallelism 및 커스텀 CUDA 커널
- Flash-attention을 활용한 최적화된 Transformer 코드
- bitsandbytes를 통한 양자화(Quantization)
- 처리량 향상을 위한 Continuous batching
- safetensors를 이용한 빠른 가중치 로딩
지원되는 주요 모델 아키텍처는 Llama, Falcon, BLOOM, StarCoder, GPT-NeoX, FLAN-T5 등이다. 사용자는 이를 통해 HuggingChat과 동일한 기술 스택을 AWS 환경에서 활용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.