AI Briefing

DeepMind의 TIPSv2 비전-언어 인코더

·2026.04.21 09:00

핵심 내용

TIPSv2는 iBOT++, Head-only EMA, 멀티 그레뉼러리 캡션으로 패치-텍스트 정렬을 크게 끌어올렸다.

1 / 2

자세히 보기

DeepMind의 TIPSv2는 이미지-텍스트 인코더의 다음 세대로, 표준 pretraining보다 distillation이 patch-text alignment를 더 잘 만든다는 뜻밖의 차이를 파고든다. 특히 작은 student가 더 큰 teacher를 제치며 zero-shot segmentation에서 더 강한 성능을 내는 현상을 관찰했고, 그 핵심 원인을 visible token supervision으로 좁혀냈다.

이를 바탕으로 pretraining을 세 가지 방식으로 고쳤다.

  • iBOT++: masked patch만이 아니라 모든 token에 patch-level self-distillation loss를 적용해 dense alignment를 강화
  • Head-only EMA: EMA를 전체 모델이 아니라 projector head에만 적용해 학습 파라미터를 42% 줄이면서 성능 유지
  • Multi-Granularity Captions: alt-text와 PaliGemma 캡션에 더해 Gemini Flash 캡션을 섞어 더 풍부한 텍스트 supervision 제공

가장 큰 변화는 iBOT++에서 나온다. visible patch까지 supervision을 확장하자 ADE150 zero-shot segmentation에서 +14.1 mIoU가 개선됐고, patch 단위 표현이 훨씬 더 촘촘하게 정렬됐다.

시각화에서도 차이가 분명하다. PCA feature map에서 TIPSv2는 기존 TIPS와 SigLIP2보다 객체 경계가 더 또렷하고, DINOv3처럼 매끄러운 표현을 유지하면서도 의미 단위 분할이 더 세밀하다.

성능 평가는 더 넓다. TIPSv2는 9개 task, 20개 dataset에서 강한 결과를 보였고, dense image-text 영역에서는 4개 zero-shot segmentation benchmark 모두에서 SOTA를 기록했다. global image-text에서는 7개 평가 중 5개에서 best 또는 second-best를 차지했고, image-only task에서는 9개 중 7개에서 best 또는 second-best였다.

비교 실험에서도 인상적이다. 가장 큰 공통 크기인 ViT-L 기준으로 DINOv3와 비교했을 때, TIPSv2는 DINOv3 teacher보다 6배 적은 파라미터, 15배 적은 이미지로도 공유 평가 6개 중 4개를 이겼다. 최종적으로 TIPSv2는 patch-text alignment를 중심으로 한 pretraining 재설계가 distillation 수준의 dense 표현을 pretraining에서 직접 끌어올릴 수 있음을 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.