AI Briefing

Scribe V2 Realtime의 작동 원리

·2026.04.10 14:58

ElevenLabs의 **Scribe v2 Realtime**은 실시간 전사를 지원하는 초고속 STT 모델이다.

Scribe v2 Realtime은 실시간 전사(Transcription)를 위해 설계된 초고속 Speech to Text (STT) 모델이다. 비동기 방식인 Scribe v2와 달리, 실시간 언어 번역과 같이 즉각적인 피드백이 필요한 서비스에 최적화되어 있다.

API 사용 시 보안을 위해 클라이언트 사이드 스트리밍에서는 API 키를 직접 노출하는 대신, 서버에서 생성한 **단일 사용 토큰(single-use token)**을 사용하여 연결한다.

전사 데이터는 두 가지 유형으로 구분된다:

  • Partial transcripts: WebSocket을 통해 실시간으로 스트리밍되는 '라이브 전사' 데이터이다.
  • Committed transcripts: 문맥을 파악하여 정확도를 높인 '확정된 전사' 데이터이다.

사용자는 Commit Strategy를 통해 확정 시점을 결정할 수 있다. 직접 제어하는 Manual 방식과, **VAD(Voice Activity Detection)**를 통해 침묵 구간을 감지하여 자동으로 확정하는 방식이 있다. 문맥이 확보된 Committed transcript를 사용하면 "I scream"과 "Ice cream" 같은 유사 발음 오류를 줄여 훨씬 높은 정확도를 얻을 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.