DeepSpeed 및 FairScale 통합 지원
Fit More and Train Faster With ZeRO via DeepSpeed and FairScale
·2021.01.19 09:00
Hugging Face Trainer에서 DeepSpeed와 FairScale의 ZeRO 기능을 통해 대규모 모델 학습 효율을 높이는 방법을 설명한다.
Hugging Face transformers v4.2.0부터 DeepSpeed와 FairScale의 ZeRO(Zero Redundancy Optimizer) 기능을 실험적으로 지원한다. 이를 통해 GPU 메모리 부족 문제를 해결하고 대규모 모델의 학습 효율을 극대화할 수 있다.
주요 기능 및 효과:
- DeepSpeed 통합: CPU 오프로딩을 지원하여 GPU 메모리 한계를 넘어 더 큰 배치 사이즈로 학습이 가능하다.
- FairScale (sharded_ddp): 모델 상태를 샤딩하여 메모리 사용량을 최적화한다.
- 학습 효율 향상:
t5-large모델 벤치마크 결과, 기존 DDP 방식 대비 DeepSpeed 사용 시 배치 사이즈를 50까지 확장할 수 있으며 학습 속도가 크게 개선된다.
사용자는 Trainer의 --deepspeed 및 --sharded_ddp 인자를 통해 해당 기능을 간편하게 적용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.