비디오 토큰화 효율을 높이는 적응형 메커니즘 연구
Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting [R]
·2026.06.11 18:32
비디오의 시간적 중복성을 활용해 토큰을 동적으로 할당함으로써 추론 속도를 획기적으로 높인 연구입니다.
기존의 비디오 토큰화 방식은 정보량을 추정하기 위해 추가적인 연산 비용이 발생하는 한계가 있었습니다. 본 연구는 고정된 비디오 토크나이저의 잠재 공간(Latent space)에 내재된 **시간적 중복성(Temporal redundancy)**을 직접 활용하는 방식을 제안합니다.
핵심 메커니즘은 다음과 같습니다:
- 매개변수 없는 적응형 토큰 할당: 인접 프레임 간의 잠재 표현 차이(Temporal-L1 difference)에 고정 임계값을 적용하여, 변화가 적은 위치의 토큰을 자동으로 제거합니다.
- Latent Inpainting Transformer (LIT): 제거된 위치의 정보를 복원하기 위해 경량화된 시공간 어텐션 구조인 LIT를 도입했습니다.
이 프레임워크는 단 한 번의 인코더 패스와 LIT의 순전파만으로 작동하여 매우 효율적입니다. 실험 결과, 기존의 연속형 적응형 베이스라인(ElasticTok-CV) 대비 31배, 이산형 정보 이론 베이스라인(InfoTok) 대비 2배 빠른 추론 속도를 기록하며 높은 재구성 품질을 입증했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.