AI Briefing

LightNav-0 공개

LightNav-0: 깊이 센서 없이 전방 RGB 카메라 하나로 여러 로봇을 움직이는 4B 내비게이션 모델

·2026.09.07 16:00

핵심 내용

Light Origins가 깊이 센서 없이 전방 RGB 카메라 하나로 여러 로봇을 제어하는 4B 파라미터 내비게이션 모델 LightNav-0를 공개했다.

1 / 4

자세히 보기

Light Origins가 사전학습된 Vision-Language Model(VLM)의 공간 추론 능력을 로봇 제어에 직접 활용하는 LightNav-0를 공개했다. 이 모델은 Qwen3-VL-4B-Instruct를 백본으로 사용하며, 전용 내비게이션 모듈이나 작업 구분 토큰 없이 자연어 지시문만으로 지시 따르기, 물체 찾기, 대상 추적을 수행한다.

핵심 기술 및 구조

  • 단일 모델 통합: 별도 헤드 없이 백본의 자기회귀 언어 모델 헤드를 통해 공간 추론과 행동 코드를 출력한다. 행동 출력은 잔차 벡터 양자화(RVQ) 행동 토큰 3개로 디코딩되어 10단계 SE(2) 경유점(waypoint)을 생성한다.
  • 센서 의존성 최소화: 전방 RGB 스트림 한 줄기만 사용하며, 깊이 센서, 주행거리계(odometry), 파노라마 장비가 필요 없다.
  • 로봇 이식성: 로봇 몸체와 무관한 공통 기하 인터페이스를 사용하므로, 바퀴형, 4족, 휴머노이드 등 다양한 로봇에 별도 재학습 없이 같은 체크포인트로 이식 가능하다.

성능 및 벤치마크 결과

  • 지시 따라가기(VLN-CE): R2R val-unseen에서 SR 68.5%, SPL 62.8%를 기록하여 기존 단안(monocular) 시스템 대비 우수한 성능을 보였다.
  • 체화 시각 추적(EVT-Bench): 단일 대상 추적(STT)에서 SR 91.7%, 방해물 포함 추적(DT)에서 SR 82.6%로 최고 성공률을 달성했다. 특히 방해물이 있는 환경에서 파노라마/다중 카메라 시스템보다 성능이 앞선다고 밝혔다.
  • 스케일링 분석: 백본 크기를 2B에서 4B로 키우면 성능이 상승하지만 8B에서는 오히려 저하되는 경향을 보였다. 파라미터 수보다 학습 환경의 다양성이 성능 향상에 더 큰 기여를 했다.

배포 및 활용

  • Apache 2.0 라이선스로 공개되며, 시뮬레이션 벤치마크 하네스와 배포용 코드를 제공한다.
  • GPU 호스트에서 모델을 실행하고 로봇은 얇은 WebSocket 클라이언트로 작동하는 구조로, 실제 로봇 배포 시 저수준 제어기와의 연동을 위한 ROS 2 스택 및 어댑터(Unitree Go2 등)를 포함한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.