ElevenLabs, TTS 모델 Eleven v4와 v4 Turbo 공개
핵심 내용
ElevenLabs가 저지연 TTS 모델 Eleven v4와 v4 Turbo를 출시했다.
자세히 보기
ElevenLabs가 가장 표현력이 뛰어난 텍스트 음성 변환(TTS) 모델 Eleven v4와 실시간 애플리케이션용 저지연 변형 Eleven v4 Turbo를 출시했다. Artificial Analysis 랭킹 1위를 차지한 Eleven v4는 Cartesia Sonic 3.6, Google Gemini TTS 등 경쟁 모델과의 블라인드 비교 테스트에서 청취자의 약 75%로부터 선호를 받았다. 새로운 아키텍처는 톤, 속도, 맥락을 해석하여 기계적이지 않고 자연스러운 음성을 생성하는 데 초점을 맞췄다.
성능 및 지연 시간
Eleven v4 Turbo는 높은 표현력과 속도를 결합해 첫 음성 출력까지의 중앙값 시간을 약 150ms로 달성했다. 이는 테스트에서 262ms에서 814ms 범위를 보인 경쟁 모델보다 훨씬 빠르다. 이 모델은 ElevenLabs의 ElevenAgents 플랫폼과 원활하게 연동되도록 최적화되어, 헬스케어 및 게임 등 산업 분야에서 반응적이고 감정적으로 지능적인 에이전트를 배포할 수 있게 한다.
표현력 및 제어
이 모델들은 자연어 설명과 [laughs], [said angrily in French accent] 같은 인라인 태그를 통해 세밀한 제어를 지원한다. Eleven v4는 이전 버전보다 방향성 프롬프트를 더 정확하게 따르며, 정밀한 내레이션과 캐릭터 연기를 가능하게 한다. 다중 화자 역학 개선으로 화자들이 고립된 대사를 전달하는 대신 맥락에 반응하는 더 자연스러운 대화가 가능해졌다.
다국어 및 클로닝 개선
두 모델 모두 90개 이상의 언어를 지원하며, 생성 중 음성이 원본 억양으로 되돌아가지 않도록 억양 준수 기능이 강화됐다. 음성 클로닝 충실도도 향상되어 Instant Voice Clones는 이제 단 10초의 오디오만으로 생성할 수 있다. 이번 업데이트는 최고 충실도 사용을 위한 Professional Voice Clones (PVC) 지원도 도입했으며, 오디오북 및 광고 등 장편 콘텐츠에서 일관된 화자 신원을 보장한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.