OpenWAM, LIBERO 벤치마크 98.6% 성공률 달성
핵심 내용
OpenWAM이 LIBERO 벤치마크에서 98.6% 성공률을 달성했다.
자세히 보기
연구진이 OpenWAM을 공개했다. 이는 비디오 백본, 상호작용 구조, 지도 학습 방법을 분리할 수 있는 합성형 월드-액션 모델(WAM)용 오픈 프레임워크다. 기존 WAM들이 여러 아키텍처 요소를 동시에 변경해 설계 선택지 비교가 어려웠던 문제를 해결하기 위해, 공유된 인과적 로봇 비디오 파운데이션과 구성 가능한 비디오-액션 상호작용 프로그램을 제공한다.
아키텍처 및 사전 학습
이 프레임워크는 Wan2.2-5B 모델을 기반으로 한다. 약 334만 개 궤적, 총 14.64k 시간의 원본 비디오로 인과적 로봇 비디오 사전 학습을 수행했다. 데이터셋에는 Open X-Embodiment, AgiBot World Beta, InternData-A1 등 출처의 실제 및 합성 로봇 조작, 인간 유도 조작, 인간 상호작용 데이터가 포함된다. 학습은 NVIDIA B200 GPU 32개로 14일간 진행됐다.
주요 아키텍처 특징:
- Mixture-of-Transformers (MoT): 사전 학습된 비디오 레이어의 너비 적응 사본으로 초기화된 5B 비디오 전문가와 2B 액션 전문가를 결합한다.
- Causal Attention: 비디오를 청크 단위로 생성하며, 각 청크는 현재/과거 관측치와 이전 청크만 참조한다.
- 4가지 상호작용 프로그램: 잠재적 흐름 매칭(latent flow matching)을 사용해 Video-then-action (VTA), Action-then-video (ATV), Joint, Decoupled 생성 순서를 지원한다.
성능 및 벤치마크
OpenWAM은 시뮬레이션과 실제 환경 모두에서 강력한 성능을 보였다.
- LIBERO 벤치마크: OpenWAM-VTA 변형은 평균 성공률 **98.6%**를 기록했다 (Object: 99.4%, Goal: 98.4%, Spatial: 98.6%, Long: 97.8%). 이는 LingBot-VA (98.5%)와 Motus (97.7%) 같은 베이스라인을 능가한다.
- 실제 조작: 두 개의 Franka Research 3 팔을 사용한 양손 작업에서 OpenWAM-VTA는 토스트 굽기, 루빅스 큐브 마지막 층 풀기, 컵 분류 작업에서 평균 성공률 **92.1%**를 달성했다.
- 추상화 결과: 로봇 비디오 사전 학습은 원본 Wan2.2 초기화 대비 LIBERO-Long 성공률을 VTA에서 29.4포인트, Joint에서 34.4포인트 향상시켰다. MoT 아키텍처는 VTA에서 공유 DiT 대비 5.0포인트 개선을 제공했다.
반사실 데이터 및 동역학 모델
연구팀은 대안적 액션 시퀀스를 시뮬레이션해 생성한 32,000개 반사실 세그먼트로 구성된 LIBERO-Long-CF 데이터셋을 도입했다. 이 데이터는 독립적으로 학습된 동역학 구성 요소의 재사용성을 크게 높인다.
- 역동역학 모델 (IDM): 반사실 데이터를 사용한 로컬 컨텍스트 IDM은 LIBERO-90 홀드아웃 작업에서 평균 성공률 **84.0%**를 기록했으며, 시연 전용 데이터로는 **21.5%**에 그쳤다.
- 순동역학 모델 (FDM): 반사실 지도 학습은 RGB 예측 오차를 34.5% 줄였고, 16가지 대안 중 올바른 미래 결과를 식별하는 정확도를 **21.1%**에서 **71.3%**로 개선했다.
통합 모델 대 전문화 모델
정책, IDM, FDM 목적을 모두 지원하는 통합 OpenWAM 체크포인트는 LIBERO-Long에서 92.8% 성공률을 기록하며 공개된 UVA 시스템 (88.0%)을 능가했다. 다만, 전문화된 모델은 여전히 더 높은 작업 성공률과 정확한 반사실 예측을 제공하므로, 합성성과 최고 성능 간 트레이드오프가 존재함을 시사한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.