AI Briefing

NVIDIA NeMo, MoE 모델 학습 속도 3.7배 향상

Accelerating Transformers Fine-Tuning with NVIDIA NeMo AutoModel

·2026.06.25 01:00

NVIDIA NeMo AutoModel이 HuggingFace Transformers v5와 결합하여 MoE 모델의 학습 효율을 극대화한다.

NVIDIA NeMo AutoModel은 HuggingFace Transformers v5를 기반으로 구축된 오픈 라이브러리로, MoE(Mixture-of-Experts) 모델의 대규모 학습 및 미세 조정을 최적화합니다.

주요 기술적 특징은 다음과 같습니다:

  • Expert Parallelism (EP)DeepEP fused all-to-all dispatch 적용
  • TransformerEngine 커널을 통한 연산 최적화
  • Transformers v5의 동적 가중치 로딩(Dynamic Weight Loading) 활용

이를 통해 기존 Transformers v5 대비 학습 처리량(Throughput)을 3.4~3.7배 향상시켰으며, GPU 메모리 사용량은 29~32% 절감하는 성과를 거두었습니다.

특히 기존 from_pretrained() API와 완벽하게 호환되므로, 코드 변경 없이 임포트 문 하나만 수정하여 즉시 최적화된 성능을 적용할 수 있다는 점이 큰 장점입니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.