AI Briefing

NeuroFlow: 비디오 ViT 속도 55배 향상

EMA-Gated Temporal Sequence Compression in Vision Transformers [P]

·2026.05.27 21:14

EMA를 활용해 비디오 내 중복 토큰을 제거함으로써 Vision Transformer의 추론 속도를 획기적으로 높였다.

NeuroFlow는 비디오 데이터의 시간적 중복성을 활용하는 동적 라우팅 프레임워크다. 패치 수준 임베딩의 **지수 이동 평균(EMA)**을 통해 '의미적 놀라움(semantic surprise)'을 추적하고, 배경과 같이 정적인 토큰을 인코더 이전에 물리적으로 제거한다.

주요 특징 및 성과:

  • 극적인 속도 향상: 1792p 고해상도 SigLIP 2 추론 시, 기존 678ms에서 11.9ms로 약 55.8배의 실시간 속도 향상을 달성했다 (임베딩 충실도 97.37% 유지).
  • 학습 불필요 (Training-free): 가중치 수정 없이 'Layer 0 Retinal Gate'와 'Layer 12 Cortical Cache'를 결합한 이중 메모리 재구성 구조를 사용한다.
  • 높은 효율성: 84.0%의 토큰 희소성(sparsity)에서도 SigLIP에서 71.55%의 zero-shot top-1 정확도를 달성하며, 밀집(dense) 모델 정확도의 92.4%를 유지한다.

또한, Phi-3-mini와 같은 LLM에 유사한 게이팅 방식을 적용했을 때 토큰 드리프트가 거의 발생하지 않음을 입증하며 모델 확장 가능성을 보여주었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.