Stable Virtual Camera 공개: 3D 카메라 컨트롤 기반 멀티뷰 비디오 생성
·2025.03.19 01:00
핵심 내용
Stable Virtual Camera는 2D 이미지를 정교한 3D 카메라 경로를 따라 움직이는 몰입형 3D 비디오로 변환하는 멀티뷰 확산 모델이다.
자세히 보기
Stable Virtual Camera는 복잡한 재구성이나 장면 최적화 과정 없이, 2D 이미지를 몰입형 3D 비디오로 변환하는 **멀티뷰 확산 모델(Multi-view Diffusion Model)**이다. 기존의 전통적인 가상 카메라 컨트롤과 생성형 AI의 강력한 성능을 결재하여, 사용자가 의도한 대로 정교하고 직관적인 3D 비디오 출력을 제공한다.
주요 기능은 다음과 같다:
- 역동적인 카메라 제어: 사용자가 정의한 궤적은 물론 360° 회전, 나선형(Spiral), 돌리 줌(Dolly Zoom), 팬(Pan), 롤(Roll) 등 14가지 이상의 역동적인 카메라 경로를 지원한다.
- 유연한 입력 및 비율: 단 한 장의 이미지부터 최대 32장의 이미지까지 입력받을 수 있으며, 추가 학습 없이도 1:1, 9:16, 16:9 등 다양한 화면 비율을 생성한다.
- 장기 비디오 생성: 최대 1,000 프레임에 달하는 긴 비디오에서도 3D 일관성을 유지하여 매끄러운 루프와 전환을 구현한다.
기술적으로는 2단계 절차적 샘플링(Two-pass procedural sampling) 방식을 사용하여 어떤 수의 입력 및 타겟 뷰도 처리할 수 있다. 먼저 앵커 뷰(Anchor views)를 생성한 후, 타겟 뷰를 청크(Chunk) 단위로 렌더링함으로써 부드럽고 일관된 결과를 도출한다. 이를 통해 ViewCrafter나 CAT3D와 같은 기존 모델을 뛰어넘는 최첨단(SOTA) 성능을 기록했다.
다만, 초기 버전에서는 인물이나 동물, 물과 같은 동적 질감이 포함된 장면에서 품질이 저하될 수 있다. 또한 카메라 경로가 물체와 겹치거나 장면이 매우 모호한 경우, 입력 이미지와 타겟 뷰의 차이가 클 때 깜빡임(Flickering) 현상이 발생할 수 있다는 한계가 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.