ElevenLabs, Scribe v2 기반 회의 전사 구축 가이드 공개
핵심 내용
ElevenLabs, Scribe v2로 실시간 150ms 레이턴시 및 배치 전사 시 1000개 키워드 지원 가이드 공개했다.
자세히 보기
ElevenLabs가 Scribe v2와 Scribe v2 Realtime 모델을 활용해 회의 전사 제품을 구축하는 가이드를 공개했다. 이 API는 수동 메모나 일반 상용 도구의 한계를 보완하며, 오디오를 타임스탬프와 화자 라벨이 포함된 텍스트로 변환한다. 90개 이상의 언어를 지원하고 기업용 개인정보 보호를 위한 Zero Retention Mode를 제공한다.
실시간 대 배치 전사
레이턴시와 정확도 요구 사항에 따라 두 가지 주요 워크플로로 구분된다.
- 실시간 전사: 라이브 자막 및 회의 중 봇을 위해 Scribe v2 Realtime을 사용한다. 오디오 입력과 텍스트 출력 간 150ms의 낮은 레이턴시를 달성한다. 활성 WebSocket 연결이 필요하며, 프롬프트용으로 최대 50개의 주요 용어를 지원한다.
- 배치 전사: 회의 후 노트 작성 및 기록 관리를 위해 Scribe v2를 사용한다. REST API를 통해 전체 녹음 파일을 비동기적으로 처리하며, 전체 대화 맥락 분석으로 더 높은 정확도를 제공한다. 특정 산업 또는 브랜드 어휘 인식을 개선하기 위해 최대 1,000개의 키워드 용어를 지원한다.
구현 세부 사항
실시간 통합을 위해 개발자는 WebSocket을 열어 오디오를 스트리밍하고 부분 또는 최종 전사 결과를 수신한다. API는 API 키 보호를 위한 일회용 토큰을 사용하는 클라이언트 측 스트리밍과 메인 API 키를 사용하는 서버 측 스트리밍 두 가지 방법을 지원한다. 커밋 전략에는 20~30초마다 권장되는 수동 커밋 또는 침묵을 기반으로 음성을 자동 분할하는 **Voice Activity Detection (VAD)**이 포함된다.
배치 전사는 오디오 파일을 Scribe v2 REST 엔드포인트에 업로드하고 결과를 수신하기 위해 웹훅을 구성하는 방식으로 이루어진다. 이 방법은 개별 오디오 채널에 고유한 화자 식별자를 태그하는 멀티채널 전사를 지원하여 컨퍼런스, 법원 녹음, 팟캐스트에 적합하다. 모델은 동적 오디오 태깅을 통해 웃음이나 발소리 같은 비음성 이벤트도 처리한다.
일반적인 과제 해결
API는 특정 기능을 통해 전형적인 전사 문제를 완화한다.
- 중복 대화: 화자 분리(diarization)와 멀티채널 전사를 통해 화자를 구분한다.
- 오해석: 'DevOps'나 브랜드 이름 같은 특정 용어를 맥락에서 인식하도록 모델을 유도하는 키워드 프롬프트로 수정한다.
- 다국어 화자: 90개 이상의 언어 간 전사를 지원하는 모델의 능력으로 코드 스위칭과 혼합 언어 회의를 수용한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.