상호작용을 고려한 비디오 객체 제거 (VOID)
·2026.04.06 09:00
넷플릭스가 객체 제거 시 물리적 상호작용까지 자연스럽게 처리하는 비디오 인페인팅 모델 VOID를 공개했다.
VOID는 비디오에서 객체를 제거할 때 그림자나 반사 같은 부수적 효과뿐만 아니라, 객체가 주변 환경에 미치는 물리적 상호작용까지 함께 처리한다. 예를 들어 기타를 들고 있는 사람을 제거하면, 기타가 자연스럽게 바닥으로 떨어지는 물리적 변화까지 구현한다.
이 모델은 CogVideoX를 기반으로 구축되었으며, 상호작용을 고려한 마스크 조건화(interaction-aware mask conditioning)를 통해 비디오 인페인팅 성능을 높였다.
모델은 시간적 일관성을 높이기 위해 두 단계의 트랜스포머 체크포인트를 순차적으로 사용한다.
- VOID Pass 1: 기본 인페인팅 모델
- VOID Pass 2: 워프 노이즈(Warped-noise)를 이용한 정제 모델
마스크 생성을 위해 Gemini API와 SAM2를 활용하며, 원활한 추론을 위해서는 40GB 이상의 VRAM(예: A100)이 필요하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.