AI Briefing

V3 오디오 태그

·2026.04.10 14:58

ElevenLabs가 오디오 태그를 통해 목소리의 감정과 전달 방식을 세밀하게 제어할 수 있는 Eleven v3 모델을 공개했다.

ElevenLabs가 새로운 모델인 Eleven v3(알파 버전)를 공개하며, 텍스트 입력 대신 오디오 태그를 사용해 음성을 제어하는 기능을 선보였다. **오디오 태그(Audio Tags)**는 대괄호 [] 안에 명령어를 입력해 감정, 톤, 휴지(pause), 속도 등 비언어적 요소를 조절하는 기술이다.

사용자는 스크립트 내 어디든 태그를 배치해 실시간으로 음성 연출을 할 수 있다. 주요 기능 카테고리는 다음과 같다.

  • 감정(Emotions): [sad], [angry], [happily] 등을 통해 목소리의 정서적 톤 설정
  • 전달 방식(Delivery direction): [whispers], [shouts], [accent] 등을 통해 음량과 에너지 조절
  • 인간적 반응(Human reactions): [laughs], [clears throat], [sighs] 등을 통해 자연스러운 음성 구현

v3 모델의 새로운 아키텍처는 텍스트 문맥을 더 깊이 이해하여 감정적 신호, 톤 변화, 화자 전환을 자연스럽게 처리한다. 이를 통해 여러 화자가 등장하는 대화에서도 중단(interruption)이나 분위기 변화를 최소한의 프롬프트로 구현할 수 있다.

현재 **Professional Voice Clones(PVC)**는 v3에 완전히 최적화되지 않았으므로, 연구 프리뷰 단계에서는 **Instant Voice Clone(IVC)**이나 설계된 목소리를 사용하는 것이 권장된다. Eleven v3는 ElevenLabs UI와 Public API(알파)를 통해 이용 가능하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.