AI Briefing

LingBot-Vision, 경계 모델링으로 DINOv3 성능 추월

LingBot-Vision: masked boundary modeling for self-supervised pretraining (0.296 NYUv2 linear-probe RMSE at 1.1B vs 0.309 for DINOv3-7B, trails on ImageNet); weights in 4 sizes[R]

·2026.07.07 02:37

경계 영역을 집중 학습하는 LingBot-Vision이 적은 데이터로도 DINOv3보다 높은 기하학적 이해도를 보였다.

LingBot-Vision은 무작위 패치 마스킹 대신, 교사 모델(Teacher)이 예측한 **경계 영역(Boundary field)**을 학생 모델(Student)에게 재구성하도록 강제하는 Masked Boundary Modeling 방식을 사용합니다.

주요 특징 및 성능은 다음과 같습니다:

  • 효율적인 학습: DINOv3의 3분의 1 미만인 1억 6,100만 장의 데이터만으로도 NYUv2 벤치마크에서 0.296 RMSE를 기록하며, 7B 규모의 DINOv3(0.309)를 앞질렀습니다.
  • 설계 핵심: 경계 필드를 per-pixel categorical distributions로 재구성하여 학습 중 모델이 붕괴(Collapse)되는 것을 방지하며, 디코딩된 세그먼트에 대해 a-contrario validation을 수행하여 학습 품질을 관리합니다.
  • 확장성: ViT-L(0.3B) 모델이 7B 모델과 유사한 성능을 내는 등 파라미터 효율성이 높으며, 데이터 스케일링 곡선에서도 DINOv2 대비 우수한 초기화 성능을 입증했습니다.

다만, ImageNet 분류 및 ADE20K, KITTI 벤치마크에서는 DINOv3 제품군에 비해 다소 낮은 성능을 보였습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.