AI Briefing

Allen Institute, MolmoMotion 공개

MolmoMotion: Language-guided 3D motion forecasting

·2026.06.18 00:26

언어 지시어를 바탕으로 물체의 미래 3D 궤적을 예측하는 MolmoMotion 모델과 데이터셋이 공개되었습니다.

Allen Institute가 텍스트 지시어와 비디오 프레임을 기반으로 물체의 미래 **3D 점 궤적(3D point trajectory)**을 예측하는 MolmoMotion을 발표했습니다. 이 모델은 기존의 렌더링 방식 대신 세계 좌표계(world space)의 3D 점을 사용하여 계산 효율성을 높였으며, 객체의 종류에 상관없이 적용 가능한 Class-agnostic 특성을 가집니다.

주요 특징 및 공개 자산은 다음과 같습니다:

  • MolmoMotion 모델: Molmo 2를 백본으로 사용하여 언어 지시와 이미지 내 객체/포인트를 연결하며, 로봇 공학 계획 및 비디오 생성 모델의 입력값으로 직접 사용 가능합니다.
  • MolmoMotion-1M: 116만 개의 비디오에서 추출한, 행동 설명이 포함된 최대 규모의 3D 점 궤적 데이터셋입니다.
  • PointMotionBench: 객체 중심의 3D 모션 예측 정확도를 측정하기 위해 설계된 2,700개의 비디오 클립 기반 벤치마크입니다.

이 모델은 로봇의 동작 계획(Robotics planning)과 텍스트 기반 비디오 생성(Trajectory-conditioned video generation) 등 다양한 다운스트림 작업에 활용될 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.