Robostral Navigate: 단일 카메라 기반 AI 내비게이션 (5분 읽기)
·2026.07.09 09:00
Robostral Navigate는 단일 RGB 카메라만으로 복잡한 환경을 자율 주행하는 8B 규모의 임바디드 AI 모델이다.
Robostral Navigate는 LiDAR나 Depth 센서 없이 오직 단일 RGB 카메라만을 사용하여 복잡한 환경을 자율 주행하는 8B 모델입니다. 이 모델은 R2R-CE(Room-to-Room in Continuous Environments) 벤치마크의 미학습(unseen) 데이터셋에서 76.6%의 성공률을 기록하며, 기존의 다중 센서 기반 방식보다 높은 효율성과 성능을 입증했습니다.
이 모델은 Pointing-based navigation 방식을 채택하여 카메라 시야 내의 목표 좌표와 도착 시의 방향을 예측합니다. 이를 통해 카메라의 특성이나 세계 규모의 변화에 유연하게 대응하며, 목표가 시야 밖에 있을 경우 로컬 좌표계 기반의 이동 명령으로 전환하여 보완합니다.
주요 특징은 다음과 같습니다:
- 높은 범용성: 바퀴형, 다리형, 비행 로봇 등 다양한 형태의 로봇에 적용 가능하며 로봇의 크기에 상관없이 작동합니다.
- 효율적인 학습: 6,000개의 장면에서 수집된 약 400,000개의 궤적(trajectories) 데이터를 시뮬레이션 환경에서 학습했습니다.
- Prefix-caching 기술: 트리 기반의 Attention-masking 전략을 사용하여 에피소드 전체를 단일 시퀀스로 압축, 학습 효율을 극대화했습니다.
- 자체 개발 모델: 기존 오픈소스 VLM에 의존하지 않고, Grounding 작업에 특화된 자체 Vision-Language Model을 기반으로 구축되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.