AI Briefing

TRL, VLM용 DPO 기능 지원

Preference Optimization for Vision Language Models

·2024.07.10 09:00

HuggingFace의 TRL 라이브러리가 시각 언어 모델(VLM)을 위한 직접 선호도 최적화(DPO) 기능을 지원한다.

기존의 지도 미세 조정(SFT) 방식은 데이터에 특정 레이블을 할당해야 하므로 비용이 많이 들지만, **선호도 최적화(Preference Optimization)**는 답변 간의 순위를 비교함으로써 인간의 판단을 더 효과적으로 모델에 반영할 수 있다.

HuggingFace의 TRL(Transformer Reinforcement Learning) 라이브러리가 이제 **시각 언어 모델(VLM)**에 대해서도 **DPO(Direct Preference Optimization)**를 지원한다. 이를 통해 개발자는 VLM이 시각적 정보와 텍스트 간의 관계를 더 정교하게 이해하도록 학습시킬 수 있다.

학습을 위해서는 질문과 이미지에 대해 **'선택된 답변(Chosen)'**과 **'거절된 답변(Rejected)'**이 쌍을 이루는 데이터셋이 필요하다. 본 가이드는 openbmb/RLAIF-V-Dataset을 활용하여 데이터를 대화형 템플릿으로 변환하고, VLM 학습을 위한 데이터 포맷팅 과정을 설명한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.