AI Briefing

세계 시뮬레이터로서의 비디오 생성 모델

·2024.02.15 17:00

OpenAI는 비디오 생성 모델 Sora를 통해 물리적 세계를 시뮬레이션하는 기술을 연구했다.

OpenAI는 다양한 해상도와 종횡비를 가진 비디오 및 이미지 데이터를 활용해 대규모 생성 모델을 학습시킨다. 이 기술의 핵심인 Sora는 최대 1분 길이의 고화질 비디오를 생성할 수 있으며, 비디오 생성 모델을 확장하여 물리적 세계의 범용 시뮬레이터를 구축하는 것을 목표로 한다.

시각적 데이터를 처리하기 위해 LLM의 토큰 개념을 차용한 visual patches 방식을 사용한다. 비디오를 먼저 저차원 latent space로 압축한 뒤, 이를 시공간적 패치(spacetime patches)로 분해하여 트랜스포머가 학습할 수 있는 형태로 만든다.

Soradiffusion transformer 구조를 채택했다. 이는 비디오 데이터를 시공간 패치 단위로 처리함으로써 다음과 같은 이점을 제공한다.

  • 다양한 규격 지원: 다양한 해상도, 지속 시간, 종횡비를 가진 비디오를 유연하게 학습하고 생성할 수 있다.
  • 구도 및 프레이밍 개선: 데이터를 원래의 종횡비대로 학습함으로써 피사체가 잘리는 현상을 줄이고 자연스러운 구도를 형성한다.
  • 샘플링 유연성: 와이드스크린부터 세로형 비디오까지 다양한 기기에 최적화된 콘텐츠를 직접 생성할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.