AI Briefing

NeuroFlow: ViT 비디오 추론 55배 가속

EMA-Gated Temporal Sequence Compression in Vision Transformers [P]

·2026.05.27 21:14

EMA를 활용해 비디오 내 중복 토큰을 제거함으로써 Vision Transformer의 추론 속도와 효율성을 극대화하는 NeuroFlow를 제안한다.

NeuroFlow는 비디오 추론 시 발생하는 시간적 중복성을 활용하여 **Vision Transformer(ViT)**의 연산 효율을 높이는 동적 라우팅 프레임워크입니다. 패치 레벨 임베딩의 **지수 이동 평균(EMA)**을 통해 의미론적 놀라움(semantic surprise)을 추적하고, 배경과 같이 정적인 토큰을 인코더 단계 이전에 물리적으로 제거합니다.

주요 성과는 다음과 같습니다:

  • Architecture C (Dual-Memory Reconstruction): 별도의 학습이 필요 없는(training-free) 추론 엔진입니다. SigLIP 모델에서 **84.0%의 토큰 희소성(sparsity)**을 달성하면서도, 기존 밀집(dense) 모델 정확도의 92.4%를 유지하며 71.55%의 zero-shot top-1 정확도를 기록했습니다.
  • Architecture B (Extreme Speedup): 정적인 토큰을 사전에 제거하여 극적인 속도 향상을 제공합니다. 1792p SigLIP 2 추론 시, 기존 678ms에서 11.9ms로 약 55.80배의 실행 시간(wall-clock) 단축을 달성했습니다.
  • LLM 확장성: Phi-3-mini와 같은 언어 모델에 유사성 게이트 바이패스를 적용했을 때, 구문 제약 생성 시 토큰 드리프트가 0%임을 확인하며 기술적 경계를 검증했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.