AI Briefing

비디오 확산 잠재 변수로부터 삼각형 스플랫 추출

·2026.06.25 09:00

FLAT은 비디오 확산 모델의 잠재 변수를 직접 삼각형 스플랫으로 매핑하여 정확한 3D 장면 기하 구조를 생성한다.

FLAT은 압축된 **비디오 확산 잠재 변수(Video Diffusion Latents)**를 명시적인 비볼륨형 장면 파라미터로 직접 매핑하는 기술을 선보였다. 기존 방식처럼 3D Gaussian을 디코딩하는 대신, 한 번의 패스로 **삼각형 스플랫(Triangle Splats)**을 예측하여 기하학적 정확도를 높였다.

이 방식은 다음과 같은 핵심 특징을 가진다:

  • 직접 삼각형 디코딩: 생성 후 최적화하는 기존 파이프라인과 달리, 잠재 변수에서 직접 삼각형 스플랫을 추출한다.
  • 기하학 특화 학습: 회전 오차로 인한 그래디언트 소실을 방지하기 위해 레이 중심의 삼각형 파라미터화와 Product Window Rendering 함수를 사용한다.
  • 사용 가능한 에셋 변환: 예측된 삼각형 덩어리를 가벼운 정제(Refinement) 단계를 거쳐 불투명한(Opaque) 에셋으로 변환하며, 이는 표준 렌더러 및 물리 엔진과 호환된다.

FLAT은 Wan-2.1 모델의 잠재 공간을 활용하도록 설계되었다. 따라서 Text-to-Video, Image-to-Video 등 다양한 Wan-2.1 변형 모델이 동일한 잠재 표현을 생성한다면, 별도의 모델 학습 없이도 즉시 삼각형 기반의 기하 구조를 생성할 수 있는 높은 유연성을 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.