AI Briefing

사람과 AI가 자연스럽게 소통하는 상호작용 모델

·2026.05.12 21:00

핵심 내용

ElevenLabs가 실시간 음성 상호작용용 모델과 기능을 공개했다.

자세히 보기

ElevenLabs는 오디오·비디오·텍스트에서 턴 기반 지연 없이 사람과 실시간으로 대화하는 interaction models를 지향한다. 플래그십은 ElevenAgents와 v3 Conversational이며, 긴급 대출 전화에서 불안한 고객을 2분도 안 돼 진정시키고 해결로 이끄는 Amanda 사례를 예시로 들었다.

성공 조건은 세 가지다.

  • sub-100ms 수준의 응답, 전화 연동은 sub-200ms 목표
  • 침묵과 발화 내용을 함께 고려하는 turn-taking
  • 톤, 속도, 감정을 상황에 맞게 살리는 expressive delivery

이미 내놓은 구성은 구체적이다. Eleven v3는 가장 표현력이 강한 Text to Speech 모델이고, Eleven v3 Conversational은 2026년 2월 ElevenAgents 안에 들어간 대화형 버전으로, TTS 모델로 선택하면 기본 turn-taking이 켜진다. Speculative turn-taking은 사용자가 잠시 침묵하는 동안 LLM 응답 생성을 미리 시작해 체감 지연을 줄인다.

여기에 Flash v2.5는 약 75ms inference의 초저지연 TTS를 제공하고, Scribe v2는 높은 정확도의 Speech-to-Text를 맡는다. ElevenAgents Expressive Mode는 [laughs], [whispers], [sighs], [slow] 태그로 발화를 문맥에 맞게 제어한다. 수치는 모델 추론 시간 기준이며, 실제 end-to-end latency는 위치와 엔드포인트에 따라 달라진다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.