Sora 시스템 카드
·2024.12.09 09:00
OpenAI가 비디오 생성 모델 Sora의 기술적 구조와 안전성 확보를 위한 대응 방안을 담은 시스템 카드를 공개했다.
Sora는 텍스트, 이미지, 비디오 입력을 통해 최대 1080p 해상도의 영상을 생성하는 OpenAI의 비디오 생성 모델이다. 디퓨전(Diffusion) 모델과 트랜스포머(Transformer) 아키텍처를 결합하여, 피사체가 화면에서 일시적으로 사라지더라도 일관성을 유지하는 뛰어난 성능을 제공한다.
DALL·E 3의 리캡셔닝(Recaptioning) 기술을 활용해 사용자의 텍스트 지시사항을 더욱 정교하게 반영하며, 정지 영상을 애니메이션으로 변환하거나 기존 영상을 확장하는 기능도 갖추고 있다.
기술적으로 Sora는 LLM의 텍스트 토큰 방식에서 영감을 얻어, 비디오를 저차원 잠재 공간으로 압축한 뒤 **스페이스타임 패치(Spacetime patches)**로 분해하여 학습한다. 데이터셋은 다음과 같이 구성된다:
- 산업 표준 머신러닝 데이터셋 및 웹 크롤링을 통한 공개 데이터
- Shutterstock, Pond5 등과의 파트너십을 통한 독점 데이터
- AI 트레이너 및 레드팀의 피드백을 포함한 인간 데이터
모델의 오남용 및 유해 콘텐츠 생성 위험을 방지하기 위해, 사전 학습 단계부터 강력한 필터링을 수행한다. 또한, 다양한 국가의 예술가 및 전문가들과 협력한 레드팀(Red teaming) 활동을 통해 안전성을 지속적으로 검증하고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.