AI Briefing

Scenema 제로샷 음성 클로닝 공개

Scenema Audio: Zero-shot expressive voice cloning and speech generation

·2026.05.14 21:29

Scenema Audio가 제로샷 감정 분리형 음성 생성 모델 가중치를 공개했다.

Scenema Audio가 모델 가중치와 추론 코드를 공개했다.

핵심은 제로샷 조건에서 감정 표현화자 정체성을 분리하는 방식이다.

  • 참고 음성은 누가 말하는지를 제공한다.
  • 프롬프트는 분노, 슬픔, 흥분, 어린아이 같은 놀람 등 어떻게 말할지를 정한다.
  • 해당 감정으로 녹음된 적 없는 목소리도 같은 감정으로 생성할 수 있다고 설명했다.

모델은 diffusion model이라 전통적인 TTS처럼 완전히 안정적이지는 않다.

  • 일부 seed에서는 반복이나 의미 없는 출력이 나온다.
  • 결과가 seed마다 달라 생성 후 선별·편집하는 워크플로에 맞다.

제작 흐름으로는 audio-first video generation도 제시했다.

  • 먼저 음성을 만들고
  • LTX 2.3, Wan 2.6, Seedance 2.0 같은 A2V 파이프라인에 넣어
  • 말과 싱크되는 영상을 생성하는 방식이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.