AI Briefing

HY-World 2.0: 멀티모달 3D 월드 모델

·2026.04.20 09:00

핵심 내용

HY-World 2.0가 텍스트·이미지·영상으로 편집 가능한 3D 세계를 만든다.

1 / 2

자세히 보기

HY-World 2.0는 텍스트, 단일 이미지, 멀티뷰 이미지, 비디오를 입력으로 받아 3D world representation을 생성·재구성하는 멀티모달 world model이다. 출력은 단순 영상이 아니라 mesh와 Gaussian Splattings(3DGS) 같은 실제 3D 자산이라서, Blender·Unity·Unreal Engine·Isaac Sim에 직접 가져다 쓸 수 있다.

핵심은 두 축이다.

  • World Generation: 텍스트나 단일 이미지를 넣으면, 네 단계 파이프라인으로 탐색 가능한 3D 세계를 만든다.
  • World Reconstruction: 멀티뷰 이미지나 비디오를 넣으면, 단일 forward pass로 깊이, surface normal, 카메라 파라미터, 3D point cloud, 3DGS 속성을 함께 예측한다.

생성 파이프라인은 HY-Pano 2.0의 panorama generation, WorldNav의 trajectory planning, WorldStereo 2.0의 world expansion, WorldMirror 2.0과 3DGS learning의 world composition으로 구성된다. 이 구조를 통해 고품질의 navigable 3D scene을 만들고, 실제로 움직이며 탐색할 수 있는 세계로 확장한다.

이 프로젝트는 기존 video world model과의 차이를 강하게 강조한다. 영상 모델은 결국 "재생하는 영상"을 만드는 데 그치지만, HY-World 2.0은 편집 가능하고 지속되는 3D asset을 만든다. 그래서 3D consistency, real-time rendering, physics collision, lighting, engine compatibility 측면에서 더 직접적인 활용성을 노린다.

WorldMirror 2.0은 특히 실용성이 크다. 멀티뷰 이미지나 캐주얼 비디오로부터 dense point cloud, depth map, surface normal, camera parameters, 3DGS를 한 번에 예측하며, 50K~500K pixels의 flexible-resolution inference를 지원한다고 설명한다. 즉, 사진이나 영상으로 디지털 트윈을 빠르게 복원하는 쪽에 초점이 맞춰져 있다.

뉴스 항목 기준으로는 2026년 4월 16일에 기술 보고서와 일부 코드를 공개했고, 같은 날 WorldMirror 2.0 추론 코드와 모델 가중치도 오픈소스화했다. 반면 전체 World Generation 추론 코드, HY-Pano 2.0, WorldNav, WorldStereo 2.0은 아직 coming soon으로 남아 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.