AI Briefing

LongCat 비디오 아바타 1.5

meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face

·2026.05.23 12:27

오디오 기반 사람 영상 생성 오픈소스 프레임워크 LongCat-Video-Avatar 1.5가 출시됐다.

미투안(Meituan) 팀이 오디오 기반 휴먼 비디오 생성을 위한 오픈소스 프레임워크 LongCat-Video-Avatar 1.5를 공개했다. 상용 수준의 안정성과 극단적인 경험적 최적화에 초점을 맞춘 업그레이드 버전이다.

주요 개선사항

Whisper-Large 오디오 인코더: 기존 Wav2Vec2를 대체해 훨씬 부드럽고 자연스러운 입술 동기화 구현 • 상용 안정성: 정확한 립싱크, 전신 시간적 안정성, 엄격한 정체성 일관성을 유지하며 긴 영상 생성 지원 • 스타일화 도메인 일반화: 애니메이션, 동물, 다중 인물 상호작용 및 객체 조작 등 복잡한 실제 조건에 강건하게 일반화 • 효율적인 8단계 추론: DMD2 기반 단계 증류로 추론을 8 NFE로 가속화하며 비용 효율적인 서빙과 뛰어난 시각적 충실도 균형 유지

지원 작업: Audio-Text-to-Video (AT2V), Audio-Text-Image-to-Video (ATI2V), Video Continuation을 네이티브로 지원하며 단일 및 다중 스트림 오디오 입력 모두와 호환된다.

인간 평가 벤치마크를 도입해 6개 응용 시나리오(뉴스 방송, 지식 교육, 일상 생활, 엔터테인먼트, 노래, 상업 홍보), 2개 언어(중국어/영어), 2개 시각 스타일(사실적/애니메이션)에 걸쳐 총 508개 이미지-오디오 소스 쌍을 구성했다. 770명의 크라우드소싱 평가자가 1~5점 척도로 인간다움을 평가해 총 13,240건의 판단을 수집했으며, 10명의 도메인 전문가가 4개 차원에 걸쳐 구조화된 품질 분석을 수행했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.