V3 오디오 태그
·2026.04.10 14:58
ElevenLabs가 오디오 태그를 통해 목소리의 감정과 전달 방식을 세밀하게 제어할 수 있는 Eleven v3 모델을 공개했다.
ElevenLabs가 새로운 모델인 Eleven v3(알파 버전)를 공개하며, 텍스트 입력 대신 오디오 태그를 사용해 음성을 제어하는 기능을 선보였다. **오디오 태그(Audio Tags)**는 대괄호 [] 안에 명령어를 입력해 감정, 톤, 휴지(pause), 속도 등 비언어적 요소를 조절하는 기술이다.
사용자는 스크립트 내 어디든 태그를 배치해 실시간으로 음성 연출을 할 수 있다. 주요 기능 카테고리는 다음과 같다.
- 감정(Emotions):
[sad],[angry],[happily]등을 통해 목소리의 정서적 톤 설정 - 전달 방식(Delivery direction):
[whispers],[shouts],[accent]등을 통해 음량과 에너지 조절 - 인간적 반응(Human reactions):
[laughs],[clears throat],[sighs]등을 통해 자연스러운 음성 구현
v3 모델의 새로운 아키텍처는 텍스트 문맥을 더 깊이 이해하여 감정적 신호, 톤 변화, 화자 전환을 자연스럽게 처리한다. 이를 통해 여러 화자가 등장하는 대화에서도 중단(interruption)이나 분위기 변화를 최소한의 프롬프트로 구현할 수 있다.
현재 **Professional Voice Clones(PVC)**는 v3에 완전히 최적화되지 않았으므로, 연구 프리뷰 단계에서는 **Instant Voice Clone(IVC)**이나 설계된 목소리를 사용하는 것이 권장된다. Eleven v3는 ElevenLabs UI와 Public API(알파)를 통해 이용 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.