UniEvo-VL, 자가 비판 기반 증류로 멀티모달 모델 성능 향상
핵심 내용
UniEvo-VL은 자가 비판을 학습 신호로 활용해 Qwen-image-2512의 GenEval 점수를 0.747에서 0.808로 개선했다.
자세히 보기
최신 멀티모달 모델은 단일 시스템 내에서 콘텐츠 생성과 이해를 모두 수행할 수 있어, 자신의 피드백을 통해 학습할 수 있는 잠재력을 지니고 있습니다. UniEvo-VL은 이 특성을 활용해 모델이 교사와 학생 역할을 동시에 수행하는 자가 진화(self-evolving) 프레임워크를 도입했습니다. 이를 통해 별도의 더 큰 외부 교사 모델이 필요하지 않게 되었습니다.
자가 증류 메커니즘
이 프레임워크는 학습 과정에서 모델의 자가 비판을 특권 정보(privileged information)로 활용합니다. 학생 모델은 원본 질문만 입력받는 반면, 교사 모델은 특권 비판 정보를 조건으로 받습니다. 학습은 학생 모델의 샘플링 궤적에 걸쳐 두 모델의 디퓨징 분포 간 상태별 발산을 최소화하는 방식으로 진행됩니다.
성능 향상
오픈소스 Qwen-image-2512를 대상으로 한 실험에서 이미지 생성 능력이 크게 개선되었습니다.
- GenEval: 점수가 0.747에서 0.808로 상승했습니다.
- GenEval2 Soft-TIFA: 점수가 32.97에서 35.53으로 상승했습니다.
한계 및 관찰
이 방법은 전반적인 생성 성능을 향상시키지만, 자가 개선이 모든 작업에서 균일하게 나타나지는 않는 것으로 나타났습니다. 특히 텍스트 렌더링이 혼합된 결과에서 차이가 있었습니다. 또한 GPT5.6-Luna 같은 더 강력한 외부 비평가와의 테스트 결과, 판별 능력이 뛰어난 모델일수록 자가 진화의 상한선을 더 높게 예측할 수 있음을 시사했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.