Stable-Layers: VLM 점수를 활용한 강화 학습 기반 이미지 레이어 분해 모델 미세 조정
·2026.06.04 01:34
Stable-Layers는 VLM의 피드백을 활용한 강화 학습을 통해 쌍을 이룬 데이터 없이 이미지 레이어 분해 모델을 미세 조정한다.
Stable-Layers는 쌍을 이룬 지도 데이터(paired supervision) 없이도 사전 학습된 레이어 분해 모델을 미세 조정할 수 있는 강화 학습 프레임워크다. Qwen-Image-Layered를 기반으로 Flow-GRPO와 LoRA 적응 기술을 적용하여 구현되었다.
이 프레임워크는 이미지당 여러 후보 분해본을 샘플링한 뒤 VLM으로 점수를 매기고, 그룹 상대적 이점(group-relative advantages)을 통해 정책을 최적화한다. 다만, VLM이 개별 샘플을 독립적으로 평가할 경우 점수 편차가 좁아져 GRPO 학습에 필요한 변동성이 부족해지는 문제가 발생한다.
이를 해결하기 위해 다음과 같은 2단계 평가 파이프라인을 제안한다:
- 5가지 편집 중심 기준에 따른 구조화된 개별 샘플 점수 산출
- VLM이 모든 후보를 나란히 비교하여 재점수화하는 그리드 기반 보정(grid-based calibration)
실험 결과, Crello 데이터셋에서 기존 모델 대비 레이어 분리 성능이 강화되었으며, 빈 레이어나 아티팩트 발생이 줄어들고 레이어별 재구성 오차(reconstruction error)가 낮아졌다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.