SageMaker용 LLM 추론 컨테이너 공개
Introducing the Hugging Face LLM Inference Container for Amazon SageMaker
·2023.05.31 09:00
핵심 내용
Hugging Face가 TGI 기반의 Amazon SageMaker 전용 LLM 추론 컨테이너를 출시했다.
자세히 보기
Hugging Face가 Amazon SageMaker에서 오픈소스 LLM을 쉽고 안전하게 배포할 수 있는 **LLM Inference DLC(Deep Learning Container)**를 출시했다.
이 컨테이너는 **Text Generation Inference (TGI)**를 기반으로 하며, 고성능 텍스트 생성을 위해 다음과 같은 최적화 기술을 지원한다:
- Tensor Parallelism 및 커스텀 CUDA 커널
- Flash-attention을 활용한 최적화된 Transformer 코드
- bitsandbytes를 통한 양자화(Quantization)
- 처리량 향상을 위한 Continuous batching
- safetensors를 이용한 빠른 가중치 로딩
지원되는 주요 모델 아키텍처는 Llama, Falcon, BLOOM, StarCoder, GPT-NeoX, FLAN-T5 등이다. 사용자는 이를 통해 HuggingChat과 동일한 기술 스택을 AWS 환경에서 활용할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.