TRL, DDPO로 Stable Diffusion RLHF 지원
Finetune Stable Diffusion Models with DDPO via TRL
·2023.09.29 09:00
핵심 내용
HuggingFace의 TRL 라이브러리가 DDPO를 지원하여 Stable Diffusion 모델의 RLHF 미세 조정을 가능하게 한다.
자세히 보기
Stable Diffusion과 같은 확산 모델이 인간의 선호도나 의도에 완벽히 부합하지 못하는 정렬(Alignment) 문제를 해결하기 위해 강화학습(RL)이 도입되고 있습니다.
**DDPO(Denoising Diffusion Policy Optimization)**는 확산 모델의 디노이징 과정을 다단계 **마르코프 결정 과정(MDP)**으로 프레임워크화합니다. 이는 기존의 보상 가중 회귀(RWR) 방식과 달리, 각 디노이징 단계의 정확한 가능도(Likelihood)를 계산함으로써 복잡한 목표를 더 효율적이고 정확하게 최적화할 수 있다는 장점이 있습니다.
HuggingFace의 trl 라이브러리에 새롭게 통합된 **DDPOTrainer**를 사용하면, 사용자는 DDPO를 활용해 Stable Diffusion 모델을 인간의 미적 기준이나 특정 의도에 맞게 미세 조정(Fine-tuning)할 수 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.