BLOOM 추론: DeepSpeed vs Accelerate
Incredibly Fast BLOOM Inference with DeepSpeed and Accelerate
·2022.09.16 09:00
DeepSpeed와 Accelerate를 활용해 176B 파라미터 BLOOM 모델의 추론 성능을 극대화하는 방법과 벤치마크를 비교한다.
176B 파라미터 규모의 BLOOM 모델을 효율적으로 추론하기 위한 최적의 하드웨어 구성과 라이브러리별 성능을 비교 분석한다.
하드웨어 및 설정
- 8x80GB A100 GPU 구성이 가장 효율적이며, 메모리가 부족할 경우 CPU/NVMe 오프로드나 8bit 양자화를 통해 대응할 수 있다.
- 양자화 사용 시 메모리 사용량은 절반으로 줄어들지만, 처리량(throughput)은 다소 감소한다.
벤치마크 결과
- 모델 로딩 속도: DeepSpeed-Inference가 약 1분 내외로 가장 빠르며, Accelerate는 약 2분 정도 소요된다.
- 추론 처리량: DeepSpeed-Inference는 Tensor Parallelism(TP)과 커스텀 CUDA 커널을 활용하여 배치 사이즈 128에서 0.69ms라는 압도적인 성능을 기록했다.
- Accelerate는 Pipeline Parallelism(PP) 방식을 사용하여 모델 호환성이 매우 높으며, DeepSpeed-ZeRO와 유사한 수준의 성능을 제공한다.
결론적으로 극단적인 추론 성능이 필요한 경우에는 DeepSpeed-Inference가 가장 유리하며, 범용적인 모델 적용과 간편한 사용성을 중시한다면 Accelerate가 적합하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.