GroundedPlanBench: 로봇 조작을 위한 공간 정합 장기 작업 계획
핵심 내용
VLM이 행동과 위치를 함께 계획하도록 만든 GroundedPlanBench와 V2GP가 성능을 끌어올렸다.
자세히 보기
기존 VLM 기반 로봇 플래너는 무엇을 할지와 어디서 할지를 분리해 처리해 왔고, 긴 작업에서는 자연어 계획의 모호함과 환각 때문에 쉽게 무너졌다. 이를 검증하기 위해 GroundedPlanBench는 실제 로봇 조작 환경 308개 scene에서 만든 1,009개 task로, 행동 계획과 공간 grounding을 함께 평가한다.
각 task는 grasp, place, open, close 네 가지 기본 동작으로 분해되며, 각 동작은 이미지 내 특정 위치에 연결된다. 명시적 지시문과 함께 “table을 정리해라” 같은 implicit instruction도 포함해, 장기·복합 작업에서 모델이 얼마나 일관되게 계획하는지 본다.
훈련 데이터 측면에서는 V2GP(Video-to-Spatially Grounded Planning) 프레임워크를 제안했다. 로봇 데모 영상에서 그리퍼 신호로 상호작용 시점을 찾고, 멀티모달 모델이 조작 대상을 설명한 뒤, Meta의 SAM3로 객체를 추적해 grasp 위치와 place 위치를 포함한 grounded plan을 자동 생성한다. 이 과정으로 43K grounded plans를 만들었고, 길이별로는 34,646개(1–4 actions), 4,368개(5–8 actions), **4,448개(9–26 actions)**로 구성됐다.
평가에서는 Qwen3-VL을 기본 모델로 사용해, 학습 전 성능과 V2GP로 미세조정한 성능을 비교했다. 분리형 접근에서는 먼저 GPT-5.2 또는 Qwen3-VL-4B가 자연어 계획을 만들고, Embodied-R1이 이를 공간적으로 grounding했지만, napkin처럼 비슷한 객체가 많은 장면에서는 표현이 모호해 같은 물체로 잘못 연결되는 사례가 발생했다.
반면 grounded planning은 계획과 grounding을 한 모델 안에서 함께 다뤄, 복잡한 실제 환경에서 더 안정적으로 동작했다. 특히 **Task Success Rate(TSR)**와 Action Recall Rate(ARR) 모두에서 개선을 보였고, Qwen3-VL-4B/32B를 V2GP로 학습했을 때 explicit·implicit instruction 전반에서 일관된 성능 향상이 확인됐다.
핵심은 로봇이 긴 작업을 수행할 때 자연어 계획만 잘 쓰는 것으로는 부족하고, 행동과 위치를 동시에 정밀하게 묶어야 한다는 점이다. 저자들은 여기에 더해, 앞으로는 world model과 결합해 다음 상태 예측까지 포함하는 방향이 유망하다고 본다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.