AI Briefing

Diffusers 기반 Dreambooth 학습 최적화 가이드

Training Stable Diffusion with Dreambooth using Diffusers

·2022.11.07 09:00

HuggingFace가 Diffusers를 활용해 Stable Diffusion의 Dreambooth 학습 시 과적합을 방지하고 품질을 높이는 최적의 설정법을 공개했다.

Dreambooth는 Stable Diffusion에 새로운 개념이나 스타일을 학습시키는 데 유용하지만, 과적합(overfitting)이 발생하기 쉽다. HuggingFace는 실험을 통해 최적의 학습 결과를 얻기 위한 가이드를 제시했다.

핵심 권장 설정

  • 학습률 및 단계: 낮은 학습률을 사용하고, 만족스러운 결과가 나올 때까지 학습 단계를 점진적으로 늘리는 것이 중요하다. 과적합을 피하기 위해 학습률과 단계 사이의 '스윗 스팟'을 찾는 것이 핵심이다.
  • 얼굴 학습: 얼굴을 학습할 때는 800~1200 단계(배치 사이즈 2, LR 1e-6 기준)가 적절하며, 과적합 방지를 위해 Prior Preservation 기술을 반드시 사용해야 한다.
  • 품질 저하 대응: 생성된 이미지가 노이즈가 심하다면 과적합을 의심해야 한다. 이 경우 DDIM 스케줄러를 사용하거나 추론 단계(inference steps)를 약 100회 정도로 늘리는 것이 효과적이다.
  • Text Encoder 미세 조정: UNet과 함께 Text Encoder를 학습시키면 품질이 크게 향상된다. 다만 더 많은 메모리가 필요하므로, 16GB GPU 환경에서는 8-bit Adam이나 fp16 학습을 활용해야 한다.
  • 토큰 선택: 반드시 sks와 같은 희귀 토큰을 사용할 필요는 없으며, 대상 객체를 설명하는 자연스러운 단어를 사용해도 무방하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.