Meta, 실시간 동기화 아바타 생성 기술 'Muse Realtime Avatar' 공개
핵심 내용
Meta가 지연 시간 870ms의 실시간 아바타 생성 기술 Muse Realtime Avatar를 출시했다.
자세히 보기
Meta가 Muse Realtime Voice를 인터랙티브한 아바타로 변환하는 Muse Realtime Avatar를 출시했다. 이 시스템은 단일 스트리밍 파이프라인으로 작동하며, 음성 토큰(VQ)이 오디오와 영상 생성을 모두 구동해 음성, 입술 움직임, 표정의 정밀한 동기화를 보장한다.
실시간 성능을 위해 Meta는 증류(distillation) 기법을 적용해 청크당 신경 함수 평가 횟수를 교사 모델의 120회에서 학생 모델의 2회로 줄였다. 이는 연산 비용을 60배 절감하면서도 높은 시각적 품질을 유지하는 방식이다. 시스템은 약 870 ms의 지연 시간으로 448x768 해상도의 초상화 영상을 초당 25프레임으로 스트리밍한다. 지속형 KV 캐시, 4비트 양자화 인식 학습, NVIDIA CUDA Graph 캡처 등 최적화를 통해 서빙 용량을 8배 늘려 단일 GB200 GPU에서 12개의 동시 세션을 지원한다.
상용 시스템과의 라이브 대화 테스트에서 평가자들은 Runway Characters 대비 **78% 대 22%**로, HeyGen LiveAvatar 대비 **88% 대 12%**로 Muse Realtime Avatar를 선호했다. 또한 추적 가능성을 위해 생성된 모든 영상에 보이지 않는 워터마크인 Meta Video Seal을 삽입하는 안전 장치를 포함한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.