Code-as-World: 영상을 실행 가능한 물리 코드로 복원하는 방식으로, 9B 모델로 Gemini 3.1 Flash 성능을 넘어선 연구
핵심 내용
MirroS가 영상을 시뮬레이터 실행 가능한 코드로 복원해 물리 추론 성능을 높인 Code-as-World 모델과 연구 결과를 공개했다.
자세히 보기
MirroS 팀이 비전 언어 모델(VLM)의 정량적 물리 추론 한계를 해결하기 위해, 영상을 픽셀이 아닌 실행 가능한 물리 코드로 복원하는 'Code-as-World' 연구를 공개했습니다. 기존 픽셀 기반 접근법은 변화의 원인을 구분하지 못해 물리량 복원이 부정확했으나, 이 연구는 물체, 관계, 물리 파라미터를 명시한 코드를 세계 표현으로 사용하여 정확한 상태 궤적을 생성합니다.
실행 가능한 세계 표현(EWR)과 에이전틱 루프
제안된 **실행 가능한 세계 표현(Executable World Representation, EWR)**은 물리 구성, 동적 진화, 시각 외형의 세 부분으로 구성됩니다. 저자들은 관측에서 EWR을 복원하는 과정을 가설 제안, 인스턴스화, 실행, 렌더링, 검증 단계를 반복하는 에이전틱 발견 루프로 정의했습니다. 이 루프는 SAM 3, VGGT-Omega 등 도구를 활용해 영상에서 깊이, 마스크, 3D 기하를 추출하고, 시뮬레이터 실행 결과와 입력 영상을 비교하며 오차를 최소화합니다.
Code-as-World-VL 모델 및 성능
연구팀은 검증된 실행 가능한 세계에서 추출한 물리량으로 학습한 Code-as-World-VL 4B와 9B 모델을 공개했습니다. 1단계에서는 이미지 평면 측정 능력을 위한 지도 미세조정(SFT)을, 2단계에서는 월드 스페이스 질문을 활용한 GRPO 강화학습을 진행했습니다. 벤치마크 결과, 4B 모델이 32B급 오픈 웨이트 모델을 능가했으며, 9B 모델은 Gemini 3.1 Flash의 성능을 상회하는 것으로 보고되었습니다.
공개 범위 및 한계
현재 저장소에는 추론 코드, QuantiPhy 평가 스크립트, 탄도 축구 예제, 그리고 4B/9B 체크포인트가 포함되어 있습니다. 다만, 에이전틱 발견 루프의 완전한 구현체, 비디오 생성 모델, 27B 추론 변형, 실행 가능한 세계 학습 데이터셋 등은 아직 공개되지 않았습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.