TRL, DDPO로 Stable Diffusion RLHF 지원
Finetune Stable Diffusion Models with DDPO via TRL
·2023.09.29 09:00
HuggingFace의 TRL 라이브러리가 DDPO를 지원하여 Stable Diffusion 모델의 RLHF 미세 조정을 가능하게 한다.
Stable Diffusion과 같은 확산 모델이 인간의 선호도나 의도에 완벽히 부합하지 못하는 정렬(Alignment) 문제를 해결하기 위해 강화학습(RL)이 도입되고 있습니다.
**DDPO(Denoising Diffusion Policy Optimization)**는 확산 모델의 디노이징 과정을 다단계 **마르코프 결정 과정(MDP)**으로 프레임워크화합니다. 이는 기존의 보상 가중 회귀(RWR) 방식과 달리, 각 디노이징 단계의 정확한 가능도(Likelihood)를 계산함으로써 복잡한 목표를 더 효율적이고 정확하게 최적화할 수 있다는 장점이 있습니다.
HuggingFace의 trl 라이브러리에 새롭게 통합된 **DDPOTrainer**를 사용하면, 사용자는 DDPO를 활용해 Stable Diffusion 모델을 인간의 미적 기준이나 특정 의도에 맞게 미세 조정(Fine-tuning)할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.