Wan-Dancer: 1분 이상의 긴 댄스 영상 생성
Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation
·2026.07.13 23:33
핵심 내용
음악의 리듬에 맞춰 1분 이상의 고화질 댄스 영상을 생성하는 Wan-Dancer 모델이 공개되었습니다.
자세히 보기
기존 확산 모델(Diffusion Model)이 20초 이상의 긴 영상을 생성할 때 겪던 시간적 드리프트(Temporal drift)와 동작 반복 문제를 해결하기 위한 새로운 계층적 프레임워크인 Wan-Dancer가 발표되었습니다.
이 모델은 프로세스를 **글로벌 키프레임 계획(Global keyframe planning)**과 로컬 시간적 정밀화(Local temporal refinement) 단계로 분리하여, 전체 곡의 맥락을 유지하며 장기적인 일관성을 확보합니다.
주요 기술적 특징은 다음과 같습니다:
- Time-mapped RoPE embeddings: 동적 프레임 레이트 적응을 통해 음악과 동작의 정밀한 정렬 구현
- Optical-flow-based loss: 동작의 연속성을 높이기 위한 광학 흐름 기반 손실 함수 적용
- Motion-speed control: 빠른 움직임에서도 고해상도 디테일을 유지할 수 있는 속도 제어 기능
실험 결과, 720p/30fps 해상도로 1분 이상의 안정적인 영상을 생성하며 기존 모델의 시간적 한계를 극복했습니다. 현재 모델 가중치와 추론 코드가 GitHub 및 HuggingFace를 통해 공개되었습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.