LingBot-Vision, 경계 모델링으로 DINOv3 성능 추월
LingBot-Vision: masked boundary modeling for self-supervised pretraining (0.296 NYUv2 linear-probe RMSE at 1.1B vs 0.309 for DINOv3-7B, trails on ImageNet); weights in 4 sizes[R]
·2026.07.07 02:37
핵심 내용
경계 영역을 집중 학습하는 LingBot-Vision이 적은 데이터로도 DINOv3보다 높은 기하학적 이해도를 보였다.
자세히 보기
LingBot-Vision은 무작위 패치 마스킹 대신, 교사 모델(Teacher)이 예측한 **경계 영역(Boundary field)**을 학생 모델(Student)에게 재구성하도록 강제하는 Masked Boundary Modeling 방식을 사용합니다.
주요 특징 및 성능은 다음과 같습니다:
- 효율적인 학습: DINOv3의 3분의 1 미만인 1억 6,100만 장의 데이터만으로도 NYUv2 벤치마크에서 0.296 RMSE를 기록하며, 7B 규모의 DINOv3(0.309)를 앞질렀습니다.
- 설계 핵심: 경계 필드를 per-pixel categorical distributions로 재구성하여 학습 중 모델이 붕괴(Collapse)되는 것을 방지하며, 디코딩된 세그먼트에 대해 a-contrario validation을 수행하여 학습 품질을 관리합니다.
- 확장성: ViT-L(0.3B) 모델이 7B 모델과 유사한 성능을 내는 등 파라미터 효율성이 높으며, 데이터 스케일링 곡선에서도 DINOv2 대비 우수한 초기화 성능을 입증했습니다.
다만, ImageNet 분류 및 ADE20K, KITTI 벤치마크에서는 DINOv3 제품군에 비해 다소 낮은 성능을 보였습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.