Eleven v4, SSML 대신 Audio Tags로 AI 음성 휴식 제어
·2026.10.02 21:00
핵심 내용
Eleven v4가 SSML 대신 맥락 기반 Audio Tags를 도입해 자연스러운 음성 휴식을 구현했다.
자세히 보기
Eleven v4는 Multilingual v2 등 이전 모델에서 사용하던 SSML 문법을 Audio Tags로 대체해, 대본에 직접 지시문을 삽입할 수 있게 했습니다. 이는 기계적인 고정 침묵 구간에서 벗어나 장면의 감정적 톤에 맞춰 맥락에 따라 조절되는 자연스러운 휴식으로 전환하는 방식입니다.
휴식 제어 3가지 방법
모델은 페이싱과 침묵을 관리하기 위해 세 가지 명확한 방법을 제공합니다:
[pause]: 짧은 호흡이나 아이디어 사이의 가벼운 구분에 해당하는 짧은 휴식을 생성합니다. 설정 대사 후 강조를 주거나 마침표가 너무 급하게 느껴지지 않도록 할 때 적합합니다.[long pause]: 극적 긴장감, 장면 전환, 또는 반전을 위한 의도적인 침묵을 생성합니다. 고정된 타이머와 달리 지속 시간이 서사적 맥락에 맞게 조절됩니다.- 구두점: 줄임표, 대시, 짧은 문장이 페이싱 지시 역할을 합니다. 줄임표는 망설임을 표현하며 전달 속도를 늦추고, 단편적인 문장은 날카로움과 직설성을 더합니다.
일관성 및 워크플로우
장편 오디오에서는 전체 대본에 걸쳐 일관된 휴식 규칙을 유지하는 것이 출력의 불일치를 방지하는 핵심입니다. 사용자는 이러한 태그를 수동으로 적용하거나, 텍스트에 Audio Tags를 자동으로 삽입하는 v4 Enhance 버튼을 사용할 수 있습니다. 이 시스템은 Voice Library의 17,500개 이상의 음성을 지원하며, 정교한 타이밍 제어를 통해 풍부한 음성 연기를 가능하게 합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.