AI Briefing

SageMaker용 LLM 추론 컨테이너 공개

Introducing the Hugging Face LLM Inference Container for Amazon SageMaker

·2023.05.31 09:00

핵심 내용

Hugging Face가 TGI 기반의 Amazon SageMaker 전용 LLM 추론 컨테이너를 출시했다.

자세히 보기

Hugging Face가 Amazon SageMaker에서 오픈소스 LLM을 쉽고 안전하게 배포할 수 있는 **LLM Inference DLC(Deep Learning Container)**를 출시했다.

이 컨테이너는 **Text Generation Inference (TGI)**를 기반으로 하며, 고성능 텍스트 생성을 위해 다음과 같은 최적화 기술을 지원한다:

  • Tensor Parallelism 및 커스텀 CUDA 커널
  • Flash-attention을 활용한 최적화된 Transformer 코드
  • bitsandbytes를 통한 양자화(Quantization)
  • 처리량 향상을 위한 Continuous batching
  • safetensors를 이용한 빠른 가중치 로딩

지원되는 주요 모델 아키텍처는 Llama, Falcon, BLOOM, StarCoder, GPT-NeoX, FLAN-T5 등이다. 사용자는 이를 통해 HuggingChat과 동일한 기술 스택을 AWS 환경에서 활용할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.