AI Briefing

SemanTok, 201M 파라미터로 3.4배 큰 VideoFlexTok 성능 뛰어넘어

·2026.10.07 23:56

핵심 내용

201M 파라미터 SemanTok AR 모델이 3.4배 큰 VideoFlexTok 모델과 동등하거나 더 나은 성능을 보였다.

자세히 보기

비디오 기반 월드 모델은 자율 회귀(AR) 예측의 확장성과 디퓨전 모델의 시각적 품질을 결합하는 추세이며, 이에 따라 장면 토크나이저 선택이 충실도와 의미론적 정확도에 핵심적입니다. 기존 방법은 초기 디코더 은닉 상태에만 표현 정렬(REPA) 손실을 적용하는 한계가 있었는데, 디코더는 노이즈가 포함된 입력만으로도 이를 부분적으로 충족할 수 있습니다. SemanTok은 이러한 한계를 해결하기 위해 설계된 새로운 유연한 비디오 토크나이저입니다.

SemanTok의 작동 원리

SemanTok은 고정된 DINO 특징을 인코더에 입력하고, 각 토큰 접두어에서 이러한 특징을 재구성하는 경량 헤드를 추가합니다. 이 방식을 통해 초기 거친 토큰은 클립의 전역적 의미를 담고, 이후 토큰은 세밀한 디테일을 지정합니다. 모든 토큰 접두어에서 의미를 정렬함으로써, 다양한 크기의 AR 모델에서 높은 의미 정렬도와 비디오 충실도를 달성합니다.

성능 및 효율성

해당 방법은 상당한 효율성 향상을 입증했습니다:

  • 201M 파라미터의 SemanTok AR 모델은 크기가 3.4배인 VideoFlexTok AR 모델과 동등하거나 더 나은 성능을 보입니다.
  • 더 큰 SemanTok AR 모델은 충실도를 지속적으로 향상시킵니다.
  • 픽셀 디테일이 이후 토큰으로 미뤄지므로 짧은 토큰 접두어는 예측 비용이 낮고 생성 충실도가 더 좋습니다.

견고성

SemanTok은 분포 외(OOD) 클래스에서도 의미 정렬을 유지하며, 순수 노이즈를 포함한 모든 노이즈 수준에서 디코더에 더 높은 의미 정렬을 제공합니다. 재구성 및 생성 작업 모두에서 우수한 성능을 발휘합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.