4B VLA 모델 'Wall-OSS-0.5' 공개
Wall-OSS-0.5: 4B VLA with open training code and zero-shot real-robot evaluation[D]
·2026.05.29 01:37
X Square Robot이 오픈 소스 트레이닝 코드를 포함한 4B 규모의 VLA 모델 Wall-OSS-0.5를 공개했다.
Wall-OSS-0.5는 3B VLM 백본과 Mixture-of-Transformers 구조의 액션 전문가(action experts)를 결합한 4B 규모의 VLA(Vision-Language-Action) 모델이다.
주요 성능 지표는 다음과 같다:
- 제로샷(Zero-shot) 성능: 17개 실로봇 태스크 세트에서 평가를 수행했으며, 'Rope Tightening'과 같은 변형 가능한(deformable) 태스크를 포함해 4개 태스크에서 80 이상의 진행도를 기록했다.
- 파인튜닝 성능: 15개 태스크 세트 파인튜닝 시 평균 60.5의 진행도를 달성하여, pi0.5 대비 17.5pp 향상된 성능을 보였다.
- 임보디드 그라운딩(Embodied grounding): 일반적인 VLM 능력은 유지하면서도 관련 성능을 21.8pp 높였다.
기술적 핵심 요소로는 액션 토큰의 CE(Cross-Entropy)가 VLM 백본에 지배적인 그래디언트를 제공한다는 Gradient Bridge 개념과, 액션 토큰을 의미론적으로 그라운딩하는 Vision-Aligned RVQ Tokenizer를 사용한다. 또한, 오버헤드를 줄인 분산형 DMuon 옵티마이저를 도입했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.