AI Briefing

이미지 편집을 위한 추론 기반 보상

·2026.05.04 09:00

Edit-R1이 추론형 보상 모델로 이미지 편집 성능을 높였다.

기존 이미지 편집 reward model은 전체 점수만 내는 경우가 많아, 지시문마다 다른 요구를 세밀하게 반영하지 못했다. Edit-R1은 verifier-based RRM으로 접근해 지시를 여러 원칙으로 쪼개고, 각 항목을 따로 검증해 해석 가능한 세밀한 보상을 만든다.

학습 파이프라인은 세 단계로 구성된다.

  • SFT cold-start로 CoT reward trajectory를 먼저 만든다.
  • GCPO로 인간의 pairwise preference data를 반영해 개별 샘플 단위(pointwise) RRM을 강화한다.
  • 완성된 RRM을 비미분 가능 reward로 활용해 GRPO로 편집 모델을 학습한다.

실험에서는 Edit-RRMSeed-1.5-VLSeed-1.6-VL보다 편집 전용 reward model로 더 강했고, 3B에서 7B로 커질수록 성능이 꾸준히 올랐다. 또 FLUX.1-kontext 같은 편집 모델의 성능도 끌어올렸다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.