AI Briefing

Robostral Navigate: 단일 카메라 기반 AI 내비게이션 (5분 읽기)

·2026.07.09 09:00

핵심 내용

Robostral Navigate는 단일 RGB 카메라만으로 복잡한 환경을 자율 주행하는 8B 규모의 임바디드 AI 모델이다.

자세히 보기

Robostral Navigate는 LiDAR나 Depth 센서 없이 오직 단일 RGB 카메라만을 사용하여 복잡한 환경을 자율 주행하는 8B 모델입니다. 이 모델은 R2R-CE(Room-to-Room in Continuous Environments) 벤치마크의 미학습(unseen) 데이터셋에서 76.6%의 성공률을 기록하며, 기존의 다중 센서 기반 방식보다 높은 효율성과 성능을 입증했습니다.

이 모델은 Pointing-based navigation 방식을 채택하여 카메라 시야 내의 목표 좌표와 도착 시의 방향을 예측합니다. 이를 통해 카메라의 특성이나 세계 규모의 변화에 유연하게 대응하며, 목표가 시야 밖에 있을 경우 로컬 좌표계 기반의 이동 명령으로 전환하여 보완합니다.

주요 특징은 다음과 같습니다:

  • 높은 범용성: 바퀴형, 다리형, 비행 로봇 등 다양한 형태의 로봇에 적용 가능하며 로봇의 크기에 상관없이 작동합니다.
  • 효율적인 학습: 6,000개의 장면에서 수집된 약 400,000개의 궤적(trajectories) 데이터를 시뮬레이션 환경에서 학습했습니다.
  • Prefix-caching 기술: 트리 기반의 Attention-masking 전략을 사용하여 에피소드 전체를 단일 시퀀스로 압축, 학습 효율을 극대화했습니다.
  • 자체 개발 모델: 기존 오픈소스 VLM에 의존하지 않고, Grounding 작업에 특화된 자체 Vision-Language Model을 기반으로 구축되었습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.