ElevenLabs, 감정 연출 가능한 TTS 모델 Eleven v4 공개
핵심 내용
ElevenLabs가 감정 연출이 가능한 TTS 모델 Eleven v4를 공개했다.
자세히 보기
ElevenLabs가 감정 표현을 극대화한 최신 텍스트 음성 변환(TTS) 모델 Eleven v4를 공개했다. 이 모델은 단순한 낭독을 넘어, 사용자가 대본 내에서 지시문을 통해 톤, 속도, 한숨이나 웃음과 같은 비언어적 소리까지 직접 연출할 수 있도록 설계됐다.
Audio Tags로 퍼포먼스 지휘하기
Eleven v4의 핵심은 대본 안에 직접 삽입하는 Audio Tags다. [furious], [sarcastic], [whispers], [crying] 같은 태그를 넣어 특정 대사의 감정 상태를 지정하면, 모델이 이를 해석해 피치, 속도, 강도를 조절하며 마치 성우를 지휘하듯 연기를 수행한다.
명시적인 태그 외에도 구두점과 감정 연속성이 출력 결과에 영향을 미친다. 줄임표는 전달 속도를 늦추고, 대시는 끊김을 나타내며, 느낌표는 강도를 높인다. 문장 시작에 감정 태그를 붙이면 해당 감정이 문장 전체에 유지되어 반복적인 장면 구축이 가능하다.
실제 적용 및 한계
플랫폼은 동일한 문장 "I didn’t think you’d actually come back"을 [furious], [excited], [sarcastic], [crying], [worried] 등 5가지 태그로 렌더링해 모델의 범위를 시연했다. 각 태그는 분노를 위한 자음 강화나 비꼼을 위한 모음 신장 등 뚜렷한 음향적 차이를 만들어낸다.
최적의 결과를 위해 ElevenLabs는 다음을 권장한다:
- 지시문 반복 조정: 전달이 어긋날 경우 텍스트를 다시 쓰기보다
[sad]대신[worried]처럼 태그를 교체한다. - 전체 장면 생성: 모델에 충분한 컨텍스트를 제공하기 위해 한 번에 최대 10,000자의 단락이나 지문을 생성한다.
- 구문당 하나의 감정: 출력 품질 저하를 막기 위해 문장 세그먼트마다 단일 태그만 적용한다.
이용 가능 여부
Eleven v4는 ElevenLabs Text to Speech 앱에서 사용할 수 있다. 도입을 장려하기 위해 Creator+ 구독자는 10월 12일까지 해당 모델에 대해 3배 크레딧을 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.