AI Briefing

MoMo: 시공간 액션 토큰화를 통한 로봇 조작 모션 모드 제어

·2026.07.30 09:00

시공간 액션 토큰화를 통해 로봇이 작업 환경에 맞춰 동작 방식을 조절할 수 있는 MoMo 프레임워크를 제안한다.

로봇이 다양한 환경에서 효과적으로 작동하려면 단순히 작업을 정확히 수행하는 것을 넘어, 작업 대상과 상호작용 설정에 맞춰 동작 방식을 적응시켜야 한다. MoMo는 이러한 실행 수준의 변동성을 여러 작업에서 공유 가능한 재사용 행동 인자로 학습할 수 있는 2단계 모방 학습(Imitation Learning) 프레임워크다.

MoMo는 다음과 같은 핵심 구조로 이루어진다:

  • Spatiotemporal Action Tokenizer: 시공간적 액션 토큰화 수행
  • Behavior-Cloning Transformer: 작업(Task)과 연속적인 모션 모드(Motion-mode) 조건을 입력으로 받아 동작을 생성

6가지 실제 로봇 조작 작업 실험을 통해, 모션 모드 조건을 변경하는 것만으로도 로봇의 동작 스타일을 안정적으로 조절할 수 있음을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.