AI Briefing

NVIDIA-HuggingFace, 확산 모델 훈련 통합 공개

Fine-tune video and image models at scale with NVIDIA NeMo Automodel and 🤗 Diffusers

·2026.07.18 00:57

NVIDIA와 HuggingFace가 확산 모델 미세조정을 위한 NeMo Automodel 통합을 공개했다.

NVIDIA NeMo Automodel은 PyTorch DTensor 기반의 오픈소스 훈련 라이브러리로, HuggingFace의 Diffusers 생태계와 완전히 통합되어 대규모 분산 확산 모델 훈련을 지원한다.

주요 특징:

  • 체크포인트 변환 불필요: HuggingFace Hub의 모든 Diffusers 모델에 직접 적용 가능
  • 확장성: FSDP2, 텐서 병렬화, 파이프라인 병렬화 등을 YAML 설정만으로 선택 가능
  • 메모리 효율: 잠재공간 VAE 캐싱, 다중해상도 버킷팅, 활성화 체크포인팅 지원
  • LoRA 지원: 전체 미세조정과 파라미터 효율적 미세조정 모두 가능

지원 모델: FLUX.1-dev (12B), FLUX.2-dev (32B), Wan 2.1 (1.3B~14B), HunyuanVideo 1.5 (13B), Qwen-Image (20B)

성능: H100 8개 기준 FLUX.1-dev 전체 미세조정은 스텝당 0.9초, 이미지/초 35.5개 달성. LoRA 기반 학습은 메모리 사용량 23~67GB 범위.

오픈소스 Apache 2.0 라이선스로 제공되며 SLURM, 향후 Kubernetes 지원 포함.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.