AI Briefing

이미지 편집을 위한 추론 기반 보상

·2026.05.04 09:00

핵심 내용

Edit-R1이 추론형 보상 모델로 이미지 편집 성능을 높였다.

자세히 보기

기존 이미지 편집 reward model은 전체 점수만 내는 경우가 많아, 지시문마다 다른 요구를 세밀하게 반영하지 못했다. Edit-R1은 verifier-based RRM으로 접근해 지시를 여러 원칙으로 쪼개고, 각 항목을 따로 검증해 해석 가능한 세밀한 보상을 만든다.

학습 파이프라인은 세 단계로 구성된다.

  • SFT cold-start로 CoT reward trajectory를 먼저 만든다.
  • GCPO로 인간의 pairwise preference data를 반영해 개별 샘플 단위(pointwise) RRM을 강화한다.
  • 완성된 RRM을 비미분 가능 reward로 활용해 GRPO로 편집 모델을 학습한다.

실험에서는 Edit-RRM이 Seed-1.5-VL과 Seed-1.6-VL보다 편집 전용 reward model로 더 강했고, 3B에서 7B로 커질수록 성능이 꾸준히 올랐다. 또 FLUX.1-kontext 같은 편집 모델의 성능도 끌어올렸다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.