AI Briefing

Cohere STT 화자분리 지원판

I fine-tuned Cohere Transcribe to support diarization and timestamps

·2026.05.23 05:17

Cohere Transcribe 오픈소스 음성인식 모델에 화자 분리와 타임스탬프 기능을 추가한 파인튜닝 버전이 공개됐다.

최고 성능의 오픈소스 음성-텍스트 변환 모델로 평가받는 Cohere Transcribe에 화자 분리(diarization)와 타임스탬프 기능을 추가한 파인튜닝 버전이 Hugging Face에 무료로 공개됐다.

기존 Cohere Transcribe는 토크나이저에 관련 토큰이 포함돼 있음에도 화자 식별 및 시간 정보 출력을 지원하지 않았다. 이번 파인튜닝 모델은 표준 타임스탬프 형식을 따르며, 다음과 같은 출력을 생성한다:

<|spltoken0|><|t:0.0|> Welcome back. <|t:1.5|><|spltoken1|><|t:1.5|> Thanks. <|t:2.4|>

주요 성능 지표:

  • 타임스탬프 정확도: 평균 0.097초 이내, 90%는 0.006초 이내
  • 30초 구간당 최대 4명의 화자 구분 지원
  • diarize_long.py 스크립트 사용 시 최대 32명까지 식별 가능

모델은 Hugging Face에서 자유롭게 사용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.