AI Briefing

LingBot-Depth 2.0: 센서 데이터 기반 깊이 추정

Masked depth modeling with sensor-validity masking: reports best RMSE on 7 of 8 masked/sparse depth benchmarks, plus a controlled encoder-init study[R]

·2026.07.07 18:54

센서의 결측 영역을 학습 신호로 활용하여 깊이 추정 성능을 극대화한 LingBot-Depth 2.0 연구 결과.

기존의 무작위 블록 드롭아웃 방식 대신, **센서의 결측 영역(Specular highlights, 투명한 표면, 질감이 없는 영역 등)**을 마스킹 신호로 사용하는 Sensor-validity masking 기법을 제안한다. 이를 통해 모델이 실제 추론 시 마주하게 될 실패 분포를 학습하도록 유도한다.

Ant Group 산하 Embodied AI 기업인 Robbyant의 LingBot-Depth 2.0 연구에 따르면, 동일한 파이프라인에서 인코더 초기화(Encoder-init)만 변경하여 성능을 비교한 결과 LingBot-Vision 초기화 방식이 대부분의 벤치마크에서 우수한 성능을 보였다. (단, Hammer 캡처 데이터에서는 DINOv2가 우세)

주요 성과는 다음과 같다:

  • 8개의 블록 마스크 및 희소 깊이 벤치마크 중 7개에서 최고 RMSE 기록
  • 6개의 실제 카메라 구성(Hammer, ClearGrasp, 자체 데이터셋)에서 우수한 성능 입증
  • 특히 투명 물체 대상 ClearGrasp 캡처에서 가장 강력한 성능을 보였으며, DIODE-Indoor RMSE는 1.0 버전 대비 약 절반 수준으로 개선됨

현재 Depth 2.0 가중치는 공개되지 않았으나, LingBot-Vision 4종의 백본 모델은 Apache-2.0 라이선스로 공개되어 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.