Microsoft, World-R1 발표
Microsoft Presents "World-R1": Reinforcing 3D Constraints for Text-to-Video Generation
·2026.04.29 01:56
Microsoft가 World-R1을 공개해 Text-to-Video의 3D 일관성을 높였다.
World-R1은 비디오 생성 모델의 기하학적 불일치를 줄이기 위해, 아키텍처를 바꾸지 않고 reinforcement learning으로 3D 제약을 주입한다.
이를 위해 세계 시뮬레이션용 pure text dataset을 만들고, Flow-GRPO에서 사전학습된 3D foundation model과 vision-language model의 피드백을 보상으로 활용한다.
보상은 3D-aware reward와 aesthetic reward를 함께 써서 구조적 일관성과 시각 품질을 동시에 맞춘다. 여기에 주기적 분리 학습(periodic decoupled training) 을 넣어 정적 장면의 기하 정합과 동적 장면의 움직임 유연성을 번갈아 조정한다.
평가에서는 기존 foundation model의 시각 품질을 유지하면서 3D consistency를 개선했다고 제시한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.