AI Briefing

SageMaker용 LLM 추론 컨테이너 공개

Introducing the Hugging Face LLM Inference Container for Amazon SageMaker

·2023.05.31 09:00

Hugging Face가 TGI 기반의 Amazon SageMaker 전용 LLM 추론 컨테이너를 출시했다.

Hugging Face가 Amazon SageMaker에서 오픈소스 LLM을 쉽고 안전하게 배포할 수 있는 **LLM Inference DLC(Deep Learning Container)**를 출시했다.

이 컨테이너는 **Text Generation Inference (TGI)**를 기반으로 하며, 고성능 텍스트 생성을 위해 다음과 같은 최적화 기술을 지원한다:

  • Tensor Parallelism 및 커스텀 CUDA 커널
  • Flash-attention을 활용한 최적화된 Transformer 코드
  • bitsandbytes를 통한 양자화(Quantization)
  • 처리량 향상을 위한 Continuous batching
  • safetensors를 이용한 빠른 가중치 로딩

지원되는 주요 모델 아키텍처는 Llama, Falcon, BLOOM, StarCoder, GPT-NeoX, FLAN-T5 등이다. 사용자는 이를 통해 HuggingChat과 동일한 기술 스택을 AWS 환경에서 활용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.