ElevenLabs, 실시간 전사 모델 'Scribe V2 Realtime' 공개
·2026.04.10 14:58
ElevenLabs가 150ms 미만의 초저지연 성능을 갖춘 실시간 전사 모델 **Scribe V2 Realtime**을 공개했다.
Scribe V2 Realtime은 실시간 사용 사례를 위해 설계된 초저지연 Speech to Text(STT) 모델이다. 보이스 에이전트, 회의 어시스턴트, 실시간 자막 생성 등에 최적화되어 있으며, 90개 언어에 대해 150ms 미만의 지연 시간을 제공한다.
특히 에이전트 활용 사례에 특화되어 설계되었다. 배경 소음과 복잡한 정보가 포함된 500개의 고난도 샘플 테스트에서 기존 모델들을 압도하는 성능을 보였으며, 주요 30개 유럽 및 아시아 언어에서 93.5%의 정확도를 달성했다.
주요 기능은 다음과 같다:
- Negative latency: 다음 단어 및 문장 부호 예측
- 자동 언어 감지: 대화 중 언어 전환 지원
- Text conditioning: 이전 배치 기반의 연속적인 전사 지원
- VAD(Voice Activity Detection) 및 Manual commit 기능
- 기업용 보안: SOC 2, ISO 27001, HIPAA 등 다양한 컴플라이언스 준수
해당 모델은 현재 ElevenLabs API와 ElevenLabs Agents를 통해 바로 사용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.