Speech To Speech
·2026.04.10 14:58
핵심 내용
ElevenLabs가 원본의 감정과 억양을 유지하며 목소리를 변환하는 Voice Changer와 실시간 상호작용에 최적화된 Turbo v2를 공개했다.
1 / 2
자세히 보기
ElevenLabs가 원본 녹음의 감정, 타이밍, 속도, 발음을 그대로 유지하면서 목소리만 바꾸는 Voice Changer를 출시했다. 이는 텍스트 기반의 text-to-speech가 구현하기 어려운 미세한 감정 표현과 정교한 전달력을 제어할 수 있게 해준다.
사용자는 직접 녹음하거나 업로드한 음성을 통해 특정 문구의 강조점, 휴지(pause), 리듬 등을 시연할 수 있으며, 이를 타겟 목소리에 그대로 적용할 수 있다. 기술적으로는 원본 음성의 내용을 타겟 음성의 **음소(phonemes)**를 사용하여 렌더링하는 방식을 사용한다. 이는 얼굴 교체(face-swapping) 기술과 유사하며, 타겟 음성의 특성과 원본의 감정적 특징 사이의 균형을 맞추는 것이 핵심이다.
주요 업데이트 사항은 다음과 같다:
- Eleven Turbo v2: 실시간 상호작용에 최적화된 모델로, IVR 시스템을 위한 (m)uLaw 8kHz 형식을 지원한다.
- Studio 기능 강화: 오디오북 제작 가이드라인에 맞춘 게인 조정, 다이내믹 컴프레션 및 메타데이터(ISBN, 저자, 제목) 삽입 기능을 지원한다.
- 음성 라이브러리 개편: 기존 음성을 교체하고 향후 몇 주 내에 20개 이상의 신규 음성을 추가할 예정이다.
- 발음 사전(Pronunciation dictionary): 사용자 요청이 많았던 발음 제어 기능이 도입된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.