LongCat 비디오 아바타 1.5
meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face
핵심 내용
오디오 기반 사람 영상 생성 오픈소스 프레임워크 LongCat-Video-Avatar 1.5가 출시됐다.
자세히 보기
미투안(Meituan) 팀이 오디오 기반 휴먼 비디오 생성을 위한 오픈소스 프레임워크 LongCat-Video-Avatar 1.5를 공개했다. 상용 수준의 안정성과 극단적인 경험적 최적화에 초점을 맞춘 업그레이드 버전이다.
주요 개선사항
• Whisper-Large 오디오 인코더: 기존 Wav2Vec2를 대체해 훨씬 부드럽고 자연스러운 입술 동기화 구현 • 상용 안정성: 정확한 립싱크, 전신 시간적 안정성, 엄격한 정체성 일관성을 유지하며 긴 영상 생성 지원 • 스타일화 도메인 일반화: 애니메이션, 동물, 다중 인물 상호작용 및 객체 조작 등 복잡한 실제 조건에 강건하게 일반화 • 효율적인 8단계 추론: DMD2 기반 단계 증류로 추론을 8 NFE로 가속화하며 비용 효율적인 서빙과 뛰어난 시각적 충실도 균형 유지
지원 작업: Audio-Text-to-Video (AT2V), Audio-Text-Image-to-Video (ATI2V), Video Continuation을 네이티브로 지원하며 단일 및 다중 스트림 오디오 입력 모두와 호환된다.
인간 평가 벤치마크를 도입해 6개 응용 시나리오(뉴스 방송, 지식 교육, 일상 생활, 엔터테인먼트, 노래, 상업 홍보), 2개 언어(중국어/영어), 2개 시각 스타일(사실적/애니메이션)에 걸쳐 총 508개 이미지-오디오 소스 쌍을 구성했다. 770명의 크라우드소싱 평가자가 1~5점 척도로 인간다움을 평가해 총 13,240건의 판단을 수집했으며, 10명의 도메인 전문가가 4개 차원에 걸쳐 구조화된 품질 분석을 수행했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.