AI Briefing

ViT용 Elastic Cores 공개

Elastic Attention Cores for Scalable Vision Transformers [R]

·2026.05.13 20:51

핵심 내용

core-periphery block-sparse attention으로 ViT의 고해상도 비용을 줄였다.

1 / 2

자세히 보기

ViT의 dense self-attention은 토큰 수가 늘수록 N²로 비싸지는데, 이 방법은 core-periphery block-sparse attention으로 계산량을 2NC + C²로 낮춘다.

nested dropout으로 학습해 테스트 시 core token 수를 조절할 수 있게 했고, 그에 따라 추론 비용도 탄력적으로 맞출 수 있다.

  • DINOv3와 비교해도 경쟁력 있는 dense feature와 분류 정확도를 보였다.
  • 256~1024 해상도 범위에서 성능이 안정적이었다.
  • 초기 층의 attention map은 isotropic했고, 깊어질수록 의미적으로 정렬됐다.
  • core token 수를 줄이면 attention이 더 넓고 diffuse해지고, 늘리면 더 작고 concentrated해졌다.

논문은 arXiv에 공개됐고, 코드는 GitHub에서 아직 진행 중이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.