AI Briefing

STARFlow-V: 정규화 흐름 기반 엔드투엔드 비디오 생성 모델링

·2026.04.30 09:00

STARFlow-V가 diffusion 없이도 고품질 자가회귀 비디오 생성을 입증했다.

STARFlow-V는 **normalizing flows(NF)**를 비디오 생성에 적용한 엔드투엔드 모델이다. end-to-end 학습우도(likelihood) 추정을 자연스럽게 제공하면서, diffusion이 주류인 비디오 생성 구도에 새로운 대안을 제시한다.

최근 제안된 STARFlow를 바탕으로, 모델은 spatiotemporal latent space에서 동작하는 global-local architecture를 사용한다. 인과 의존성은 글로벌 latent space에만 제한하고, 프레임 내부의 로컬 상호작용은 유지해 시간에 따른 오류 누적을 줄인다.

여기에 flow-score matching을 추가해 경량 causal denoiser로 자가회귀 생성의 일관성을 높이고, video-aware Jacobi iteration으로 내부 업데이트를 병렬화 가능한 반복으로 재구성해 샘플링 효율을 끌어올린다.

  • 동일한 모델로 text-to-video, image-to-video, video-to-video를 지원한다.
  • 실험에서는 diffusion 기반 기준선 대비 강한 시각적 품질과 시간적 일관성, 실용적인 샘플링 처리량을 보였다.
  • 저자들은 이를 정규화 흐름이 고품질 자가회귀 비디오 생성에 가능하다는 첫 증거로 보고, world models를 향한 유망한 방향으로 제시한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.