AI Briefing

추천FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree: 4단계 추론으로 영상·오디오 동시 생성

FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree

·2026.08.29 23:13

텍스트 프롬프트 한 줄로 영상과 오디오가 동기화된 결과물을 만들어낸다. MiniMax H3 기반의 35B 파라미터 모델을 DMD2 증류 기법으로 압축해, 단 4번의 Transformer 순전파로 생성 과정을 끝낸다.

VSA-H3 어텐션 백엔드와 90% 희소성을 적용해 연산 효율을 높였다. 복잡한 모션이나 미세한 디테일, 일부 오디오 품질은 원본 모델 대비 떨어질 수 있으나, 빠른 속도로 시제품을 검증하거나 리소스가 제한된 환경에서 유용하다.

B200 GPU 4장 구성에서 테스트된 기본 설정을 제공한다. CUDA 13 및 Blackwell 아키텍처를 우선 지원하며, 다른 멀티 GPU 환경에서는 Triton 커널과 특정 플래그를 통해 실행할 수 있다.

HuggingFace
HuggingFace 모델

FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree

원문에 등록된 설명이 없습니다.

text-to-video

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.