Stable Video 4D 2.0: 단일 비디오 기반 고정밀 신규 뷰 및 4D 생성 업그레이드
·2025.05.21 00:00
핵심 내용
Stability AI가 단일 비디오로부터 고정밀 4D 에셋과 신규 뷰를 생성하는 Stable Video 4D 2.0을 공개했다.
자세히 보기
**Stable Video 4D 2.0(SV4D 2.0)**은 단일 객체 중심 비디오를 활용해 역동적인 4D 에셋을 생성하는 멀티뷰 비디오 확산 모델이다. 기존 SV4D를 업그레이드하여 실제 비디오에서도 더 높은 품질의 결과물을 제공하며, 게임 캐릭터용 스프라이트 시트 제작부터 영화 및 가상 세계 에셋 지원까지 전문적인 워크플로우에 최적화되어 있다.
주요 업그레이드 사항은 다음과 같다:
- 고정밀 4D 출력: 정적 3D 에셋에서 모션 단계로 이어지는 단계별 학습을 통해 더 선명하고 일관된 4D 결과를 생성한다.
- 참조 뷰 불필요: 별도의 멀티뷰 참조 이미지 없이 단일 비디오만으로 직접 작동한다.
- 네트워크 아키텍처 재설계: 3D 공간 및 시간적 특징을 결합하는 3D attention 메커니즘을 도입해 시공간적 일관성을 높였다.
- 실제 환경 일반화 성능 개선: 합성 데이터 학습에도 불구하고 사전 학습된 비디오 모델의 지식을 활용해 실제 비디오에서도 일관된 성능을 유지한다.
벤치마크 분석 결과, SV4D 2.0은 LPIPS(이미지 충실도), FVD-V(멀티뷰 일관성), FVD-F(시간적 일관성), FV4D(4D 일관성) 등 주요 지표에서 1위를 기록하며 SOTA 성능을 달성했다. 또한 Diffusion^2, SV3D, SV4D 등의 모델보다 뛰어난 신규 뷰 합성(Novel-view synthesis) 성능을 입증했다.
현재 SV4D 2.0은 Stability AI Community License에 따라 상업적 및 비상업적 용도로 모두 사용 가능하다. 모델은 Hugging Face에서 다운로드할 수 있으며, 관련 코드는 GitHub에서 확인할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.