AI Briefing

OpenWAM, 로봇 WAM 설계 비교용 오픈소스 스택 공개

OpenWAM: 로봇 World-Action Model의 설계 선택을 하나씩 바꿔 비교하는 모듈형 사전학습 스택

·2026.09.14 09:30

핵심 내용

싱가포르국립대 등 연구진이 로봇 World-Action Model의 설계 변수를 비교하는 모듈형 스택 OpenWAM을 공개했다.

1 / 4

자세히 보기

싱가포르국립대, 칭화대 등 연구진이 로봇 **World-Action Model(WAM)**의 성능 원인 분리를 위해 설계 선택지를 모듈화한 OpenWAM 스택을 공개했다. 기존 WAM은 백본, 표현, 추론 등이 결합되어 있어 개별 요소의 기여도를 파악하기 어려웠던 문제를 해결하기 위해 개발되었다.

OpenWAM 구성 및 특징

OpenWAM은 OpenWAM-Infra(모듈형 인프라), OpenWAM-Study(통제 실험), OpenWAM-α(공개 모델)로 구성된다. PyTorch 기반이며 Hydra YAML 설정과 WebSocket 배포를 지원한다.

  • 모듈화: 시각 인코더 4종, 영상 백본 5종, 아키텍처 6종, 어텐션 마스크 4종 등을 조합하여 실험할 수 있다.
  • 아키텍처: Single-system, Dual-system, VLM 이해 전문가를 추가한 Tri-system 등을 지원한다.
  • 추론 가속: DiT 캐시와 torch.compile을 적용하여 추론 속도를 개선했다.

OpenWAM-α 모델 및 성능

OpenWAM-α는 인간 영상과 로봇 데이터를 포함해 약 6,400시간 분량으로 사전학습되었다. Wan2.2-VAE를 시각 인코더로, Wan2.2-TI2V-5B DiT를 세계 스트림으로 사용한다.

  • WAM vs VLA: WAM은 행동 지도와 미래 영상 latent 예측을 모두 사용하므로 ID(분포 내) 과제에서는 정확도가 높지만, OOD(분포 외)에서는 긴 예측 구간의 오차 누적 문제로 열세다. 반면 VLA는 행동 지도만 사용하므로 OOD에서 상대적으로 우위를 보인다.
  • 벤치마크: LIBERO-Plus 등에서는 카메라 및 노이즈 교란에 취약한 모습을 보였다. 이는 픽셀 수준 예측의 한계로 분석된다.

적용 가이드 및 요구사항

  • 권장 대상: 아키텍처 비교 연구자, 미세조정 팀.
  • 비추천 대상: 즉시 배포를 원하는 팀 (권장 환경인 80GB VRAM GPU 8장 필요, 교란에 취약).
  • 라이선스: OpenWAM 자체는 Apache-2.0을 따르며, 영상 백본 및 벤치마크 데이터는 별도 라이선스가 적용된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.