AI Briefing

NVIDIA, 3D 포즈 기반 1인칭 영상 생성 모델 EgoControl 공개

EgoControl: 3D 전신 포즈로 1인칭 시점 영상을 제어하는 비디오 확산 모델 (feat. NVIDIA)

·2026.07.28 06:30

3D 전신 포즈 시퀀스를 조건으로 사실적인 1인칭 시점 영상을 생성하는 비디오 확산 모델이다.

University of Bonn, Lamarr Institute, NVIDIA 연구진이 공동 발표한 EgoControl은 카메라 착용자의 **3D 전신 포즈(3D full-body pose)**를 기반으로 1인칭(egocentric) 영상을 생성하는 모델입니다.

기존 비디오 생성 모델들이 텍스트나 카메라 궤적 등 상위 수준의 신호에 의존하여 신체 관절의 세밀한 움직임을 제어하지 못했던 한계를 극복했습니다. EgoControl은 다음과 같은 특징을 가집니다.

  • 정밀한 제어: 머리부터 발끝까지의 3D 골격 움직임을 입력받아, 그에 대응하는 시각적 결과(손의 움직임, 물체 상호작용, 가림 현상 등)를 생성합니다.
  • 고해상도 영상 생성: 프레임을 하나씩 생성하는 자기회귀 방식 대신, 영상 전체를 한 번에 생성하는 **잠재 조건부 비디오 확산 모델(Latent Conditional Video Diffusion Model)**을 사용하여 높은 시간적·공간적 해상도를 확보했습니다.
  • 활용 분야: 체화된 AI(Embodied AI)의 행동 시뮬레이션, 로봇 조작 계획, AR/VR 및 원격 조작 시스템의 시각적 예측 등에 활용될 수 있습니다.

이 연구는 CVPR 2026에 채택되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.