ElevenLabs, Eleven v4 Audio Tags 가이드 공개… 50개 이상 예시 제공
핵심 내용
ElevenLabs가 1위 모델 Eleven v4의 Audio Tags 가이드를 공개했다.
자세히 보기
ElevenLabs가 상위 랭크 TTS 모델 Eleven v4의 Audio Tags 가이드를 공개했다. [whispers]나 [excited]처럼 대괄호 안에 자연어를 입력해 감정, 속도, 효과음 등 세부적인 연기를 지시할 수 있다.
핵심 기능 및 순위
Eleven v4는 현재 Artificial Analysis Speech Arena에서 1319 Elo 점수로 Sonic 3.6 등을 제치고 1위를 차지하고 있다. Audio Tags는 이러한 고품질 기반 위에 구체적인 연기 지시를 더한다. 태그는 새 태그가 나올 때까지 지속되어 문장이나 단락 전체의 감정 톤을 유지하며, [whispering, fearful]처럼 쉼표로 여러 태그를 조합해 뉘앙스를 겹칠 수 있다.
태그 분류 및 예시
가이드는 태그를 다음과 같이 분류한다:
- 감정:
[excited],[playful]등 높은 에너지,[mad],[aggressive]등 격앙된 감정,[anxious],[scared]등 긴장감,[tired],[bored]등 낮은 에너지,[peaceful],[thoughtful]등 차분한 감정을 포괄한다. - 전달 방식 및 볼륨: 감정과 독립적으로 강도를 조절하며
[shouts],[softly],[low, threatening]등이 있다. - 속도: 긴장감이나 코미디 효과를 위해
[slowly],[rushed],[pause]등으로 속도를 조절한다. - 인간다운 반응:
[laughs],[sighs],[gasps],[crying]등 비언어적 소리를 추가해 현실감을 높인다. - 액센트 및 캐릭터:
[British accent],[French accent],[pirate voice]등으로 하나의 목소리 내에서 페르소나를 전환한다. - 효과음:
[thunder rumbling],[footsteps],[door creaking]등 비언어적 이벤트를 생성에 직접 도입한다.
맞춤 설정 및 모범 사례
사용자는 고정된 목록에 구애받지 않고 [out of breath after running up the stairs]나 [a tired detective who has heard it all before]처럼 복잡한 상황이나 캐릭터 특성을 묘사하는 커스텀 태그를 작성할 수 있다. Text to Speech 앱은 생성당 최대 10,000자를 지원해 다층적인 지시를 담기에 충분하다.
최적의 결과를 위해 ElevenLabs는 작성 전 감정 휠을 참고하고, 전달이 어긋날 경우 문장 재작성 대신 태그를 교체하며, 연기가 흐려지지 않도록 절(clause)당 하나의 태그만 사용할 것을 권장한다. Audio Tags는 ElevenAPI를 통해 Eleven v4, Eleven v4 Turbo, Eleven v3와 호환된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.