Speech To Speech
·2026.04.10 14:58
ElevenLabs가 원본의 감정과 억양을 유지하며 목소리를 변환하는 Voice Changer와 실시간 상호작용에 최적화된 Turbo v2를 공개했다.
ElevenLabs가 원본 녹음의 감정, 타이밍, 속도, 발음을 그대로 유지하면서 목소리만 바꾸는 Voice Changer를 출시했다. 이는 텍스트 기반의 text-to-speech가 구현하기 어려운 미세한 감정 표현과 정교한 전달력을 제어할 수 있게 해준다.
사용자는 직접 녹음하거나 업로드한 음성을 통해 특정 문구의 강조점, 휴지(pause), 리듬 등을 시연할 수 있으며, 이를 타겟 목소리에 그대로 적용할 수 있다. 기술적으로는 원본 음성의 내용을 타겟 음성의 **음소(phonemes)**를 사용하여 렌더링하는 방식을 사용한다. 이는 얼굴 교체(face-swapping) 기술과 유사하며, 타겟 음성의 특성과 원본의 감정적 특징 사이의 균형을 맞추는 것이 핵심이다.
주요 업데이트 사항은 다음과 같다:
- Eleven Turbo v2: 실시간 상호작용에 최적화된 모델로, IVR 시스템을 위한 (m)uLaw 8kHz 형식을 지원한다.
- Studio 기능 강화: 오디오북 제작 가이드라인에 맞춘 게인 조정, 다이내믹 컴프레션 및 메타데이터(ISBN, 저자, 제목) 삽입 기능을 지원한다.
- 음성 라이브러리 개편: 기존 음성을 교체하고 향후 몇 주 내에 20개 이상의 신규 음성을 추가할 예정이다.
- 발음 사전(Pronunciation dictionary): 사용자 요청이 많았던 발음 제어 기능이 도입된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.