Eleven v3 오디오 태그를 통한 음성 내 서사적 지능 구현
·2026.04.10 14:58
ElevenLabs가 오디오 태그를 통해 음성에 감정과 리듬을 부여하는 **Eleven v3**의 서사적 지능 기능을 공개했다.
ElevenLabs의 Eleven v3 모델은 단순한 음성 합성을 넘어, 이야기의 감정적 리듬과 구조적 흐름을 이해하고 형성하는 **서사적 지능(Narrative Intelligence)**을 제공한다.
사용자는 [pause], [awe], [dramatic tone]과 같은 **오디오 태그(Audio Tags)**를 사용하여 문장의 전개 방식과 호흡을 세밀하게 제어할 수 있다. 이는 단순한 텍스트 읽기를 넘어, 화자의 의도와 분위기를 반영한 스토리텔링 디렉팅을 가능하게 한다.
주요 오디오 태그 카테고리는 다음과 같다:
- 스토리 비트:
[pause],[continues softly],[hesitates],[resigned] - 톤 설정:
[dramatic tone],[lighthearted],[reflective],[serious tone] - 화자 관점:
[awe],[sarcastic tone],[wistful],[matter-of-fact] - 리듬 및 흐름:
[slows down],[rushed],[emphasized]
이 기능은 다큐멘터리, 내적 독백, 제품 설명 등 다양한 분야에서 목소리가 주의를 끌거나 분위기를 조성해야 할 때 유용하게 활용될 수 있다.
다만, 현재 **Professional Voice Clones(PVCs)**는 v3에 완전히 최적화되지 않아 품질이 낮을 수 있다. 따라서 v3의 기능을 온전히 활용하려면 **Instant Voice Clone(IVC)**이나 설계된 목소리를 사용하는 것이 권장된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.