ElevenLabs 호스팅 LLM
·2026.04.08 08:05
ElevenLabs가 에이전트 플랫폼에 자체 호스팅 LLM을 도입해 음성 에이전트의 지연 시간을 단축하고 비용 효율성을 높였다.
ElevenLabs가 에이전트 플랫폼에 ElevenLabs-hosted LLMs를 도입하여 더욱 빠르고 효율적인 **음성 에이전트(voice agents)**를 구현한다. 오픈 소스 모델을 자체 인프라에서 직접 호스팅함으로써 초저지연성을 달성하고 추론 비용을 절감하며, 고객이 별도의 외부 제공업체 없이도 에이전트를 배포할 수 있도록 지원한다.
주요 모델은 다음과 같다:
- GLM 4.5 Air: 높은 추론 정확도와 도구 호출(tool-calling) 성능을 제공하며, 기존 대안 대비 약 1/3 수준의 비용으로 운영 가능하다.
- Qwen3-30b-a3b: 가벼운 추론 작업에 최적화되어 있으며, **150ms 미만의 첫 문장 생성 시간(Time To First Sentence)**을 통해 자연스러운 대화 경험을 제공한다.
이번 업데이트의 핵심은 공동 배치(co-located) 아키텍처다. 호스팅된 LLM은 자체 STT(Speech to Text), TTS(Text to Speech) 및 턴 테이킹(turn-taking) 모델과 동일한 환경 내에서 작동한다. 이러한 통합 아키텍처를 통해 지연 시간을 줄이고 신뢰성과 데이터 보안을 강화했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.