ElevenLabs의 새로운 STT 모델, Scribe
·2026.04.10 14:58
ElevenLabs가 99개 언어를 지원하며 업계 최고 수준의 정확도를 갖춘 STT 모델 Scribe를 공개했다.
ElevenLabs가 첫 번째 Speech to Text(STT) 모델인 Scribe를 출시했다. Scribe는 99개 언어를 지원하며, 다음과 같은 기능을 제공한다.
- 단어 단위 타임스탬프 및 화자 분리(speaker diarization)
- 오디오 이벤트 태깅 (예: 웃음소리 등)
- 구조화된 JSON 응답을 통한 원활한 통합
Scribe는 FLEURS 및 Common Voice 벤치마크에서 Gemini 2.0 Flash, Whisper Large V3, Deepgram Nova-3를 능가하는 성능을 입증했다. 특히 이탈리아어(98.7%), 영어(96.7%) 등 97개 언어에서 업계 최저 수준의 **단어 오류율(WER)**을 기록했다.
또한 세르비아어, 광둥어, 말라얄람어와 같이 기존 모델의 오류율이 40%를 상회하던 소외 언어에서도 정확도를 대폭 개선하여 **ASR(자동 음성 인식)**의 범용성을 높였다.
개발자는 Speech to Text API를 통해 즉시 통합할 수 있으며, 크리에이터와 기업은 ElevenLabs 대시보드에서 파일을 직접 업로드하여 사용할 수 있다. 실시간 애플리케이션을 위한 저지연(low-latency) 버전도 곧 출시될 예정이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.