AI Briefing

LingBot-Depth 2.0: 센서 데이터 기반 깊이 추정

Masked depth modeling with sensor-validity masking: reports best RMSE on 7 of 8 masked/sparse depth benchmarks, plus a controlled encoder-init study[R]

·2026.07.07 18:54

핵심 내용

센서의 결측 영역을 학습 신호로 활용하여 깊이 추정 성능을 극대화한 LingBot-Depth 2.0 연구 결과.

자세히 보기

기존의 무작위 블록 드롭아웃 방식 대신, **센서의 결측 영역(Specular highlights, 투명한 표면, 질감이 없는 영역 등)**을 마스킹 신호로 사용하는 Sensor-validity masking 기법을 제안한다. 이를 통해 모델이 실제 추론 시 마주하게 될 실패 분포를 학습하도록 유도한다.

Ant Group 산하 Embodied AI 기업인 Robbyant의 LingBot-Depth 2.0 연구에 따르면, 동일한 파이프라인에서 인코더 초기화(Encoder-init)만 변경하여 성능을 비교한 결과 LingBot-Vision 초기화 방식이 대부분의 벤치마크에서 우수한 성능을 보였다. (단, Hammer 캡처 데이터에서는 DINOv2가 우세)

주요 성과는 다음과 같다:

  • 8개의 블록 마스크 및 희소 깊이 벤치마크 중 7개에서 최고 RMSE 기록
  • 6개의 실제 카메라 구성(Hammer, ClearGrasp, 자체 데이터셋)에서 우수한 성능 입증
  • 특히 투명 물체 대상 ClearGrasp 캡처에서 가장 강력한 성능을 보였으며, DIODE-Indoor RMSE는 1.0 버전 대비 약 절반 수준으로 개선됨

현재 Depth 2.0 가중치는 공개되지 않았으나, LingBot-Vision 4종의 백본 모델은 Apache-2.0 라이선스로 공개되어 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.