Gaudi2 기반 BLOOMZ 추론 가속화
Fast Inference on Large Language Models: BLOOMZ on Habana Gaudi2 Accelerator
·2023.03.28 09:00
🤗 Optimum Habana을 통해 Habana Gaudi2 가속기에서 176B 규모의 BLOOMZ 모델을 효율적으로 배포하고 추론하는 방법을 소개한다.
176B 파라미터를 가진 BLOOMZ 모델은 16비트 정밀도 기준 약 352GB의 메모리가 필요하여 단일 장치로 배포하기 매우 까다롭다.
Habana Gaudi2는 96GB 메모리를 가진 8개의 HPU(Habana Processing Unit)를 포함하는 서버 구성을 통해 이러한 대규모 모델을 수용할 수 있는 환경을 제공한다. Gaudi2는 병렬 연산에 최적화된 아키텍처를 통해 LLM 학습 및 추론 성능을 극대화한다.
주요 기술적 특징은 다음과 같다:
- Optimum Habana: Gaudi2와 🤗 Transformers 라이브러리를 연결하여 모델 배포를 간소화한다.
- SynapseAI™ SDK: 연산자 융합(operator fusion), 데이터 레이아웃 관리, 병렬화 등을 통해 실행을 최적화한다.
- DeepSpeed 통합: 모델 및 파이프라인 병렬화를 지원하여 대규모 모델을 여러 장치에 효율적으로 분산시킨다.
벤치마크 결과, Gaudi2는 Nvidia A100 80GB 대비 대규모 모델 추론에서 뛰어난 성능을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.