Shengshu, 실시간 음성 제어 영상 모델 Vidu S1 공개
Vidu S1: Shengshu가 공개한 음성으로 실시간 제어하는 무한 길이 대화형 영상 생성 모델 (및 이에 대한 연구)
·2026.07.21 12:30
사용자의 음성 지시에 따라 실시간으로 반응하며 무한히 생성되는 대화형 영상 모델 Vidu S1이 공개되었습니다.
Tsinghua University와 Shengshu Technology가 공동 발표한 Vidu S1은 기존의 오프라인 일괄 생성 방식에서 벗어나, 사용자가 생성 도중 음성으로 개입하여 영상의 방향을 실시간으로 바꿀 수 있는 대화형 영상 생성 모델입니다.
이 모델은 기존 자기회귀(Autoregressive) 모델들이 가진 한계인 오차 누적으로 인한 화면 붕괴(Drift) 문제를 해결하여, 영상이 끊김 없이 무한히 이어질 수 있도록 설계되었습니다. 또한 TurboDiffusion 및 TurboServe 기술을 기반으로 하여 소비자용 GPU에서도 540p 해상도, 최대 42 FPS의 빠른 추론 속도를 구현했습니다.
핵심 특징:
- 실시간 상호작용: 생성 중 언제든 음성 명령을 통해 캐릭터의 동작을 제어 가능
- 무한 길이 생성: 오차 누적 완화 기술을 통해 안정적인 스트리밍 생성 지원
- 높은 효율성: 저비용 GPU 환경에서도 실시간 수준의 프레임워크 제공
- 다양한 캐릭터 지원: 실제 인물부터 애니메이션, 반려동물까지 커스텀 캐릭터 적용 가능
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.