AI Briefing

Scribe V2 Realtime의 작동 원리

·2026.04.10 14:58

핵심 내용

ElevenLabs의 **Scribe v2 Realtime**은 실시간 전사를 지원하는 초고속 STT 모델이다.

자세히 보기

Scribe v2 Realtime은 실시간 전사(Transcription)를 위해 설계된 초고속 Speech to Text (STT) 모델이다. 비동기 방식인 Scribe v2와 달리, 실시간 언어 번역과 같이 즉각적인 피드백이 필요한 서비스에 최적화되어 있다.

API 사용 시 보안을 위해 클라이언트 사이드 스트리밍에서는 API 키를 직접 노출하는 대신, 서버에서 생성한 **단일 사용 토큰(single-use token)**을 사용하여 연결한다.

전사 데이터는 두 가지 유형으로 구분된다:

  • Partial transcripts: WebSocket을 통해 실시간으로 스트리밍되는 '라이브 전사' 데이터이다.
  • Committed transcripts: 문맥을 파악하여 정확도를 높인 '확정된 전사' 데이터이다.

사용자는 Commit Strategy를 통해 확정 시점을 결정할 수 있다. 직접 제어하는 Manual 방식과, **VAD(Voice Activity Detection)**를 통해 침묵 구간을 감지하여 자동으로 확정하는 방식이 있다. 문맥이 확보된 Committed transcript를 사용하면 "I scream"과 "Ice cream" 같은 유사 발음 오류를 줄여 훨씬 높은 정확도를 얻을 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.