Eleven v4, 인라인 IPA와 발음 사전으로 정밀한 발음 제어 가능
·2026.10.01 21:00
핵심 내용
Eleven v4는 인라인 IPA와 음소 규칙을 지원하지만 SSML phoneme 태그는 미지원이다.
자세히 보기
발음 제어 방법
Eleven v4는 브랜드명, 약어, 전문 용어의 발음 문제를 해결하기 위해 발음 사전과 인라인 IPA를 통해 세밀한 TTS 발음 제어를 제공합니다. 모델이 복잡한 텍스트를 자연스럽게 처리하지만, 사용자는 별칭 또는 음소 기반 규칙을 통해 고유 어휘의 특정 발음을 강제할 수 있습니다.
Eleven v4에서 음성 출력 커스터마이징에 사용할 수 있는 세 가지 주요 방법은 다음과 같습니다:
- 인라인 IPA: 한 번의 수정을 위해 스크립트 내에 슬래시(
/)로 감싼 국제음성기호 전사(예:/ˌkuː.bərˈnɛt.iːz/)를 직접 작성합니다. - 음소 규칙: 반복되는 단어를 위해 발음 사전에 정확한 음성 철자를 정의합니다.
- 별칭 규칙: 모델이 발화하기 전에 특정 텍스트를 대체 철자로 교체합니다(예: "SaaS"를 "sass"로).
ElevenAPI를 통해 요청당 최대 3개의 발음 사전을 지원하며, Text to Speech 앱에서 생성하거나 .pls 파일로 업로드하거나 API로 관리할 수 있습니다.
SSML 호환성 및 대안
Eleven v4는 SSML phoneme 태그를 지원하지 않습니다. 대신 표준 SSML 기능을 직접 대체하는 방식을 제공합니다:
<phoneme>은 인라인 IPA 또는 사전 음소 규칙으로 대체됩니다.<sub alias>는 사전 별칭 규칙으로 대체됩니다.<break>는[pause], 줄임표, 줄 바꿈 등의 Audio Tags로 대체됩니다.<prosody rate>는[slowly]와 같은 속도 조절 Audio Tags로 대체됩니다.
이 접근 방식은 90개 이상의 언어에서 유창한 발음을 가능하게 하면서 일관된 사운드 브랜딩을 유지합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.