VideoFlexTok: 유연한 길이의 Coarse-to-Fine 비디오 토큰화
·2026.07.02 09:00
VideoFlexTok은 비디오를 추상적 정보부터 세부 사항까지 단계적으로 표현하여 학습 효율과 생성 길이를 획기적으로 개선했다.
기존의 비디오 토큰화 방식은 비디오를 3D 그리드 형태로 표현하여, 모델이 영상의 복잡도와 상관없이 모든 저수준 디테일을 픽셀 단위로 예측해야 하는 높은 학습 복잡도 문제를 안고 있었다.
VideoFlexTok은 비디오를 Coarse-to-Fine(조밀에서 세밀로) 구조를 가진 가변 길이 토큰 시퀀스로 표현한다. 초기 토큰은 의미(Semantics)와 움직임 같은 추상적 정보를 포착하고, 후속 토큰이 세부적인 디테일을 추가하는 방식이다. 이를 통해 생성 모델은 다운스트림 작업의 요구사항에 따라 토큰 수를 유연하게 조절할 수 있다.
주요 성과는 다음과 같다:
- 학습 효율성: 기존 3D 그리드 방식 대비 5배 작은 모델(1.1B vs 5.2B)로도 유사한 생성 품질(gFVD, ViCLIP Score)을 달성했다.
- 긴 영상 생성: 10초(81프레임) 영상을 생성할 때 기존 방식보다 8배 적은 672개의 토큰만 사용하여 계산 비용을 대폭 절감했다.
- 유연성: Generative Flow Decoder를 통해 어떤 토큰 수에서도 사실적인 비디오 재구성이 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.