범용 비전 모델로서의 비디오 생성 모델
·2026.07.14 09:00
비디오 생성 모델을 활용해 다양한 시각적 인지 작업을 수행하는 범용 비전 모델 GenCeption을 제안한다.
기존의 컴퓨터 비전이 특정 작업에 특화된 모델을 사용하는 방식이었다면, GenCeption은 NLP가 범용 언어 모델로 진화한 것처럼 시각 지능의 패러다임 전환을 목표로 한다.
GenCeption은 사전 학습된 **비디오 생성 확산 모델(Video Generative Diffusion Model)**을 기반으로 풍부한 시공간적 세계 지식(World Priors)과 시각-언어 정렬 능력을 활용한다. 이후 합성 데이터 중심의 멀티태스크 Post-training을 통해 다양한 인지 작업을 수행하는 피드포워드(Feed-forward) 모델로 변환된다.
주요 성과는 다음과 같다:
- SOTA 성능 달성: Depth, Surface Normal, Camera Pose, Segmentation 등 다양한 작업에서 기존의 전용(Specialist) 모델들과 대등하거나 더 뛰어난 성능을 보인다.
- 압도적인 데이터 효율성: 기존 모델 대비 7배에서 최대 500배 적은 학습 프레임만으로도 유사한 정확도에 도달한다.
- 일반화 능력: 시뮬레이션에서 학습된 지식을 실제 환경으로 전이(Sim-to-real transfer)하거나, 학습 데이터에 없는 새로운 객체 카테고리에 대해서도 뛰어난 일반화 성능을 보인다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.