사람과 AI가 자연스럽게 소통하는 상호작용 모델
ElevenLabs가 실시간 음성 상호작용용 모델과 기능을 공개했다.
ElevenLabs는 오디오·비디오·텍스트에서 턴 기반 지연 없이 사람과 실시간으로 대화하는 interaction models를 지향한다. 플래그십은 ElevenAgents와 v3 Conversational이며, 긴급 대출 전화에서 불안한 고객을 2분도 안 돼 진정시키고 해결로 이끄는 Amanda 사례를 예시로 들었다.
성공 조건은 세 가지다.
- sub-100ms 수준의 응답, 전화 연동은 sub-200ms 목표
- 침묵과 발화 내용을 함께 고려하는 turn-taking
- 톤, 속도, 감정을 상황에 맞게 살리는 expressive delivery
이미 내놓은 구성은 구체적이다. Eleven v3는 가장 표현력이 강한 Text to Speech 모델이고, Eleven v3 Conversational은 2026년 2월 ElevenAgents 안에 들어간 대화형 버전으로, TTS 모델로 선택하면 기본 turn-taking이 켜진다. Speculative turn-taking은 사용자가 잠시 침묵하는 동안 LLM 응답 생성을 미리 시작해 체감 지연을 줄인다.
여기에 Flash v2.5는 약 75ms inference의 초저지연 TTS를 제공하고, Scribe v2는 높은 정확도의 Speech-to-Text를 맡는다. ElevenAgents Expressive Mode는 [laughs], [whispers], [sighs], [slow] 태그로 발화를 문맥에 맞게 제어한다. 수치는 모델 추론 시간 기준이며, 실제 end-to-end latency는 위치와 엔드포인트에 따라 달라진다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.