AI Briefing

ElevenLabs Scribe, 단어 단위 타임스탬프와 이벤트 태깅으로 구조화된 오디오 전사 지원

·2026.10.05 21:00

핵심 내용

ElevenLabs Scribe가 단어 단위 타임스탬프와 이벤트 태깅을 지원하는 구조화된 전사 API를 공개했다.

자세히 보기

ElevenLabs Scribe는 오디오 입력에서 직접 태그가 지정되고 타임스탬프가 포함된 토큰 객체의 구조화된 배열을 출력하는 네이티브 단어 수준 전사 기능을 제공한다. 기존 ASR 모델은 타이밍을 위해 2차 강제 정렬 프로세스가 필요한 텍스트 블록을 생성하는 반면, Scribe는 전사 중 타임스탬프를 계산하여 지연 시간과 연산 오버헤드를 줄인다.

토큰 구조 및 이벤트 태깅

모델은 모든 토큰을 세 가지 유형으로 분류한다:

  • word: 시작/종료 시간과 화자 ID가 포함된 인식된 음성 단어
  • spacing: 명시적으로 태깅된 침묵 또는 휴지 (일본어나 중국어처럼 단어 간 공백이 없는 언어에서는 제외)
  • audio_event: 웃음, 박수, 발소리, 배경 음악 등 비언어적 소리

tag_audio_events 매개변수를 활성화하면 모델이 비음성 이벤트에 타임스탬프를 붙여 전사문에 맥락을 더하고 청중 반응이나 감정 분석을 가능하게 한다.

실시간 및 멀티채널 기능

Scribe는 include_timestamps=true 및 include_language_detection=true와 같은 매개변수를 통해 WebSocket 기반 실시간 스트리밍을 지원한다. 멀티채널 오디오의 경우 최대 5개 채널을 병렬로 독립적으로 전사할 수 있다. 화자 할당은 결정적이며 (채널 0은 speaker_0에 매핑), 겹치는 대화에서 음향 화자 분리보다 더 높은 신뢰성을 제공한다.

실제 응용 및 내보내기 형식

구조화된 타임스탬프 데이터는 정확한 키워드 검색, Entity Detection을 통한 규정 준수 편집, 자동 소셜 미디어 클리핑을 가능하게 한다. Scribe는 여러 형식으로 데이터를 내보낸다:

  • JSON: 대화형 미디어 또는 검색 데이터베이스를 구축하는 개발자용
  • SRT/VTT: Adobe Premiere 등 비디오 제작 도구와의 직접 통합용
  • TXT/DOCX/PDF: 인간이 읽기 쉬운 법적 또는 감사 문서용

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.