Scenema Audio 모델 공개
Scenema Audio: Zero-shot expressive voice cloning and speech generation [N]
·2026.05.14 06:29
Scenema Audio가 감정과 화자를 분리한 음성 생성 모델의 가중치와 추론 코드를 공개했다.
Scenema Audio는 감정 표현과 화자 정체성을 분리해 다루는 zero-shot voice cloning 음성 생성 모델이다.
- 감정 프롬프트로 말투를 지정하고, 필요하면 참조 음성으로 화자 정체성을 넣는다.
- 참조 음성은 "who", 프롬프트는 "how" 역할을 하며, 해당 화자가 학습되지 않은 감정 상태도 생성할 수 있다고 설명한다.
- 모델 가중치와 inference code를 공개했으며, 회사는 이를 비디오 제작 플랫폼의 일부로 사용해 왔다.
autoregressive TTS보다 더 자연스럽고 덜 로봇처럼 들린다고 강조한다.
다만 diffusion model 특성상 일부 seed에서는 반복이나 의미 없는 발화가 생길 수 있어, 생성 후 후보를 고르고 다듬는 후편집 워크플로를 전제로 한다.
음성을 먼저 생성한 뒤 A2V 파이프라인(LTX 2.3, Wan 2.6, Seedance 2.0 등)으로 영상을 맞추는 활용도 제시했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.