Hugging Face, AWS Inferentia2 지원
Deploy models on AWS Inferentia2 from Hugging Face
·2024.05.22 09:00
Hugging Face가 AWS Inferentia2를 지원하여 10만 개 이상의 모델을 SageMaker 및 Inference Endpoints에서 배포할 수 있게 되었다.
Hugging Face가 AWS Inferentia2를 통해 모델을 배포할 수 있는 기능을 확대했다. 이제 사용자는 Hugging Face Inference Endpoints와 Amazon SageMaker에서 Inferentia2 인스턴스를 사용하여 모델을 효율적으로 서빙할 수 있다.
주요 업데이트 내용:
- SageMaker 지원 확대: Llama 3를 포함하여 BERT, RoBERTa, ViT 등 14개 모델 아키텍처와 텍스트 분류, 질문 답변 등 6개 태스크를 포함한 10만 개 이상의 공개 모델을 Inferentia2에서 배포할 수 있다.
- Inference Endpoints 도입: 클릭 몇 번으로 Inferentia2 인스턴스를 선택해 모델을 배포할 수 있다.
- Inf2-small: 2코어, 32GB 메모리 (Llama 3 8B에 적합, 시간당 $0.75)
- Inf2-xlarge: 24코어, 384GB 메모리 (Llama 3 70B에 적합, 시간당 $12)
- TGI(Text Generation Inference) 활용: Llama 3와 같은 LLM 배포 시 TGI for Neuron을 사용하여 연속 배칭(continuous batching) 및 스트리밍 기능을 지원하며, OpenAI SDK와 호환되어 기존 애플리케이션 코드 변경 없이 사용 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.