Wan-Dancer: 1분 이상의 긴 댄스 영상 생성
Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation
·2026.07.13 23:33
음악의 리듬에 맞춰 1분 이상의 고화질 댄스 영상을 생성하는 Wan-Dancer 모델이 공개되었습니다.
기존 확산 모델(Diffusion Model)이 20초 이상의 긴 영상을 생성할 때 겪던 시간적 드리프트(Temporal drift)와 동작 반복 문제를 해결하기 위한 새로운 계층적 프레임워크인 Wan-Dancer가 발표되었습니다.
이 모델은 프로세스를 **글로벌 키프레임 계획(Global keyframe planning)**과 로컬 시간적 정밀화(Local temporal refinement) 단계로 분리하여, 전체 곡의 맥락을 유지하며 장기적인 일관성을 확보합니다.
주요 기술적 특징은 다음과 같습니다:
- Time-mapped RoPE embeddings: 동적 프레임 레이트 적응을 통해 음악과 동작의 정밀한 정렬 구현
- Optical-flow-based loss: 동작의 연속성을 높이기 위한 광학 흐름 기반 손실 함수 적용
- Motion-speed control: 빠른 움직임에서도 고해상도 디테일을 유지할 수 있는 속도 제어 기능
실험 결과, 720p/30fps 해상도로 1분 이상의 안정적인 영상을 생성하며 기존 모델의 시간적 한계를 극복했습니다. 현재 모델 가중치와 추론 코드가 GitHub 및 HuggingFace를 통해 공개되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.