ViT용 Elastic Cores 공개
Elastic Attention Cores for Scalable Vision Transformers [R]
·2026.05.13 20:51
core-periphery block-sparse attention으로 ViT의 고해상도 비용을 줄였다.
ViT의 dense self-attention은 토큰 수가 늘수록 N²로 비싸지는데, 이 방법은 core-periphery block-sparse attention으로 계산량을 2NC + C²로 낮춘다.
nested dropout으로 학습해 테스트 시 core token 수를 조절할 수 있게 했고, 그에 따라 추론 비용도 탄력적으로 맞출 수 있다.
- DINOv3와 비교해도 경쟁력 있는 dense feature와 분류 정확도를 보였다.
- 256~1024 해상도 범위에서 성능이 안정적이었다.
- 초기 층의 attention map은 isotropic했고, 깊어질수록 의미적으로 정렬됐다.
- core token 수를 줄이면 attention이 더 넓고 diffuse해지고, 늘리면 더 작고 concentrated해졌다.
논문은 arXiv에 공개됐고, 코드는 GitHub에서 아직 진행 중이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.