World Labs, 3D 공간 지능형 멀티모달 모델 'Atlas' 공개
·2026.09.02 02:36
핵심 내용
World Labs가 텍스트, 이미지, 영상, 3D를 통합 처리하는 차세대 월드 모델 Atlas를 공개했다.
자세히 보기
World Labs가 텍스트, 이미지, 영상, 3D 데이터를 네이티브로 처리하는 멀티모달 오토리그레이티브 디퓨전 트랜스포머 모델 Atlas를 공개했다. 이 모델은 모든 입력을 공유된 공간 컨텍스트로 결합하여 3D 일관성을 유지하며 다음 프레임을 생성하도록 설계되었다.
주요 기능 및 특징
- 카메라 제어 생성: 참조 이미지를 기반으로 사용자가 지정한 카메라 위치와 각도에서 새로운 뷰를 생성하며, 입력되지 않은 영역까지 자연스럽게 확장한다.
- 픽셀 단위 카메라 제어: coarse한 텍스트 지시 대신 정밀한 카메라 기하학을 네이티브 입력으로 사용하여 샷 구성과 움직임을 세밀하게 통제할 수 있다.
- 공간 컨텍스트 기반 생성: 각 이미지를 3D 공간의 특정 위치에 고정하여 컨텍스트를 형성한다. 서로 관련 없는 두 이미지를 3D 공간에 배치하면 Atlas가 그 사이의 공간을 매끄럽게 이어주는 세계를 생성한다.
- 공간 재구성: 단 2~3장의 이미지로도 실제 공간을 충실하게 재구성할 수 있으며, 최대 100장 이상의 이미지를 입력해 정밀한 환경 복원이 가능하다. 이는 특수 장비나 수백 장의 밀집 뷰 없이도 가능한 기술이다.
Atlas는 향후 World Labs의 제품인 Marble 등에 적용될 예정이며, 학습 컴퓨팅 자원 증가에 따라 성능이 향상되는 확장성을 갖추고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.