AI Briefing

AWS Inferentia2 최적화 지원

Accelerating Hugging Face Transformers with AWS Inferentia2

·2023.04.17 09:00

Hugging Face가 AWS Inferentia2 최적화를 지원하여 Transformers 모델의 추론 성능과 비용 효율성을 개선했다.

Hugging Face와 AWS의 파트너십을 통해 AWS Inferentia2에서 Transformers 모델을 최적화하여 실행할 수 있게 되었다.

AWS Inferentia2는 이전 세대 대비 4배 높은 처리량10배 낮은 지연 시간을 제공한다. Amazon EC2 Inf2 인스턴스는 NVIDIA G5 인스턴스 대비 최대 2.6배 높은 처리량8.1배 낮은 지연 시간, 50% 더 나은 전력 대비 성능을 구현한다.

optimum-neuron을 사용하면 모델을 복잡하게 수정하거나 분할할 필요 없이, 단 한 줄의 코드로 Inferentia2용 컴파일이 가능하다. 또한 inf2.48xlarge와 같은 대형 인스턴스를 통해 GPT-3나 BLOOM 같은 대규모 모델도 효율적으로 배포할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.