비디오를 3D로
HY-World 2.0 released
·2026.04.16 12:05
핵심 내용
텍스트·이미지·영상으로 편집 가능한 3D 월드를 만드는 HY-World 2.0 공개.
1 / 2
자세히 보기
HY-World 2.0은 텍스트, 단일 이미지, 멀티뷰 이미지, 영상 입력을 받아 3D world를 생성·복원하는 멀티모달 월드 모델이다.
핵심은 단순한 비디오 생성이 아니라, mesh와 3DGS(Gaussian Splatting) 같은 편집 가능한 3D 자산을 직접 만든다는 점이다.
- World Generation: 텍스트/이미지 → 파노라마 생성 → 경로 계획 → 월드 확장 → 월드 합성의 4단계 파이프라인으로 3D 월드를 구성
- World Reconstruction: 멀티뷰 이미지/영상 → 한 번의 forward pass로 depth, surface normal, camera parameter, 3D point cloud, 3DGS attribute를 동시에 예측
- 실사용 지향: Blender, Unity, Unreal Engine, Isaac Sim 같은 엔진에 바로 넣을 수 있는 형태를 목표로 함
이번 공개에서 WorldMirror 2.0 inference code와 model weights는 오픈소스로 풀렸고, 기술 보고서도 함께 공개됐다. 다만 World Generation 전체 inference code, HY-Pano 2.0, WorldStereo 2.0 관련 코드는 추후 공개 예정이다.
공식 설명은 HY-World 2.0을 closed-source SOTA급 3D world model과 견줄 수 있다고 주장하며, 특히 기존 비디오 월드 모델보다 지속성, 3D 일관성, 실시간 렌더링, 물리 기반 상호작용에서 강점을 내세운다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.