HuggingFace, 소형 VLA 모델 'SmolVLA' 공개
SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data
·2025.06.03 09:00
소비자용 하드웨어에서 구동 가능한 450M 규모의 오픈소스 로봇 VLA 모델 SmolVLA가 공개되었다.
HuggingFace가 로봇 공학 연구의 진입 장벽을 낮추기 위해 설계된 경량 Vision-Language-Action (VLA) 모델인 SmolVLA를 공개했다.
SmolVLA는 450M 파라미터 규모의 모델로, 소비자용 하드웨어에서 원활하게 구동된다. Lerobot 커뮤니티의 오픈소스 데이터셋을 활용해 학습되었으며, LIBERO 및 Meta-World 시뮬레이션과 SO100/101 실물 로봇 환경에서 기존의 대규모 VLA 모델 및 ACT 베이스라인을 능가하는 성능을 입증했다.
핵심 기술적 특징은 다음과 같다:
- Flow Matching Transformer: 액션 전문가(Action Expert)로서 정교한 동작을 생성한다.
- 추론 효율화: 시각적 토큰 감소(Visual Token Reduction) 및 레이어 스킵(Layer Skipping) 기술을 적용했다.
- 비동기 추론(Asynchronous Inference): 응답 속도를 30% 개선하고 작업 처리량을 2배로 높였다.
이 프로젝트는 모델 가중치와 함께 저렴한 오픈소스 하드웨어 활용을 권장하며, 범용 로봇 에이전트 연구의 민주화를 목표로 한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.