추천Qwen-RobotWorld: Embodied Agent를 위한 무한한 세계
·2026.06.16 09:00
Qwen-RobotWorld는 자연어를 인터페이스로 활용해 다양한 로봇 형태와 환경을 통합 학습하는 차세대 Embodied World Model이다.
기존의 비디오 생성 모델은 풍부한 시각적 사전 지식을 갖췄지만 물리 법칙 모델링이 부족했고, 특정 도메인 모델은 범용성이 떨어지는 한계가 있었습니다. Qwen-RobotWorld는 자연어를 범용 액션 인터페이스로 사용하여 이 간극을 메웁니다.
이 모델은 Dual-Stream Diffusion World Model 아키텍처를 채택했습니다. Qwen2.5-VL을 액션 인코더로 사용하는 Understanding stream과 비디오 VAE를 사용하는 Generation stream이 MMDiT(Multimodal Diffusion Transformer)를 통해 상호작용하며, 이를 통해 복잡한 명령어를 정밀한 물리적 상태 변화로 변환합니다.
주요 특징은 다음과 같습니다:
- 언어 기반 통합 액션 인터페이스: 20개 이상의 로봇 형태와 500개 이상의 액션 카테고리를 자연어로 표준화하여 통합 학습.
- Scene2Robot: 인간의 동작을 14가지 로봇 형태에 맞춰 재구성하는 Human-to-Robot Transfer 기능 제공.
- 다중 뷰 기하학적 일관성: 메인 뷰, 손목 부착 뷰 등 2~4개의 카메라 스트림을 동기화하여 3D 공간 정보와 객체 정체성을 일관되게 생성.
EWK(Embodied World Knowledge) 데이터셋을 통해 860만 개의 교차 시나리오 학습 쌍을 확보했으며, 이를 통해 조작(Manipulation), 자율 주행, 실내 내비게이션 등 다양한 도메인 간의 물리적 지식 전이를 실현했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.