daVinci-MagiHuman 공개
daVinci-MagiHuman Finally Makes Open-Source AI Video Feel Realistic
핵심 내용
daVinci-MagiHuman이 통합 음성·영상 생성으로 인간 영상 품질을 끌어올렸다.
자세히 보기
daVinci-MagiHuman은 SII-GAIR와 Sand.ai가 공개한 15B 파라미터 단일 스트림 transformer로, 텍스트·비디오·오디오를 한 모델에서 함께 처리해 인간 영상의 립싱크와 표정 정합성을 높인다.
- 지원 언어: 영어, 만다린·광둥어, 일본어, 한국어, 독일어, 프랑스어
- 공개 구성: base / distilled / super resolution 모델 스택
- 라이선스: Apache 2.0
구조는 앞뒤 4개 층이 모달리티별 처리를 맡고 가운데 32개 층이 공유되는 sandwich 설계다. DMD-2 distillation으로 8 denoising steps만 사용하며, super resolution 단계는 256p 출력물을 540p 또는 1080p로 latent space에서 올려 추가 VAE 왕복을 피한다.
공식 평가에서는 2000회의 쌍대 비교에서 Ovi 1.1을 80%, LTX 2.3을 **60.9%**로 앞섰고, 지표는 시각 품질 4.80, 텍스트 정합성 4.18, 물리 일관성 4.52, 음성 WER **14.60%**였다. 단일 H100 GPU 기준으로 5초/256p는 2초, 1080p는 38초에 생성된다고 제시됐다.
실사용에는 제약도 있다. H100 GPU가 사실상 필요하고, 실행 전 외부 모델 3개를 별도 다운로드해야 하며, 첫 생성은 컴파일 워밍업 때문에 공식 속도보다 느릴 수 있다. 온라인 데모는 HuggingFace Spaces에서 제공되고, 시작 가이드는 공식 GitHub에 정리돼 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.