AI Briefing

LingBot-Vision, 경계 모델링으로 DINOv3 성능 추월

LingBot-Vision: masked boundary modeling for self-supervised pretraining (0.296 NYUv2 linear-probe RMSE at 1.1B vs 0.309 for DINOv3-7B, trails on ImageNet); weights in 4 sizes[R]

·2026.07.07 02:37

핵심 내용

경계 영역을 집중 학습하는 LingBot-Vision이 적은 데이터로도 DINOv3보다 높은 기하학적 이해도를 보였다.

자세히 보기

LingBot-Vision은 무작위 패치 마스킹 대신, 교사 모델(Teacher)이 예측한 **경계 영역(Boundary field)**을 학생 모델(Student)에게 재구성하도록 강제하는 Masked Boundary Modeling 방식을 사용합니다.

주요 특징 및 성능은 다음과 같습니다:

  • 효율적인 학습: DINOv3의 3분의 1 미만인 1억 6,100만 장의 데이터만으로도 NYUv2 벤치마크에서 0.296 RMSE를 기록하며, 7B 규모의 DINOv3(0.309)를 앞질렀습니다.
  • 설계 핵심: 경계 필드를 per-pixel categorical distributions로 재구성하여 학습 중 모델이 붕괴(Collapse)되는 것을 방지하며, 디코딩된 세그먼트에 대해 a-contrario validation을 수행하여 학습 품질을 관리합니다.
  • 확장성: ViT-L(0.3B) 모델이 7B 모델과 유사한 성능을 내는 등 파라미터 효율성이 높으며, 데이터 스케일링 곡선에서도 DINOv2 대비 우수한 초기화 성능을 입증했습니다.

다만, ImageNet 분류 및 ADE20K, KITTI 벤치마크에서는 DINOv3 제품군에 비해 다소 낮은 성능을 보였습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.