Scenema 제로샷 음성 클로닝 공개
Scenema Audio: Zero-shot expressive voice cloning and speech generation
·2026.05.14 21:29
Scenema Audio가 제로샷 감정 분리형 음성 생성 모델 가중치를 공개했다.
Scenema Audio가 모델 가중치와 추론 코드를 공개했다.
핵심은 제로샷 조건에서 감정 표현과 화자 정체성을 분리하는 방식이다.
- 참고 음성은 누가 말하는지를 제공한다.
- 프롬프트는 분노, 슬픔, 흥분, 어린아이 같은 놀람 등 어떻게 말할지를 정한다.
- 해당 감정으로 녹음된 적 없는 목소리도 같은 감정으로 생성할 수 있다고 설명했다.
모델은 diffusion model이라 전통적인 TTS처럼 완전히 안정적이지는 않다.
- 일부 seed에서는 반복이나 의미 없는 출력이 나온다.
- 결과가 seed마다 달라 생성 후 선별·편집하는 워크플로에 맞다.
제작 흐름으로는 audio-first video generation도 제시했다.
- 먼저 음성을 만들고
- LTX 2.3, Wan 2.6, Seedance 2.0 같은 A2V 파이프라인에 넣어
- 말과 싱크되는 영상을 생성하는 방식이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.