ElevenLabs, Scribe V2 공개
·2026.04.10 14:58
ElevenLabs가 대규모 배치 전사 및 자막 생성을 위한 고성능 모델 Scribe V2를 공개했다.
Scribe V2는 대규모 배치 전사(transcription), 자막 및 캡션 생성을 위해 설계된 모델이다. 기존 v1보다 긴 오디오, 일시 정지, 톤 변화, 긴 침묵 구간을 더 안정적이고 정확하게 처리하며, 업계 표준 벤치마크인 FLEURS에서 최저 단어 오류율(WER)을 기록했다.
주요 기능은 다음과 같다:
- Keyterm Prompting: 문맥을 활용해 최대 100개의 단어나 구문을 정확하게 전사하여 기술 용어나 브랜드명을 효과적으로 처리한다.
- 엔티티 감지(Entity Detection): 개인정보(PII), 의료 데이터, 결제 정보 등 56개 카테고리를 자동으로 감지하고 정확한 타임스탬프를 제공한다.
- 자동 다국어 전사: 단일 파일 내에 여러 언어가 포함되어 있어도 별도 설정 없이 언어를 자동으로 감지해 전사한다.
기업용 워크플로우를 위해 스마트 화자 분리(Diarization), 정밀한 단어 단위 타임스탬프, 웃음이나 발소리 같은 비음성 이벤트를 감지하는 다이내믹 오디오 태깅 기능을 지원한다. 또한 SOC 2, ISO 27001, HIPAA 등 다양한 보안 규정을 준수하여 엔터프라이즈 환경에 최적화되었다.
Scribe V2는 현재 ElevenLabs Studio와 API를 통해 바로 사용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.