고성능 음성 전사 모델 Transcribe
핵심 내용
Cohere가 14개 언어를 지원하는 오픈소스 ASR 모델 Transcribe를 공개했다.
자세히 보기
Cohere가 Transcribe를 공개했다. 오픈소스 ASR 모델인 이 제품은 2B 규모의 conformer-based encoder-decoder 구조로, 음성 파형을 log-Mel spectrogram으로 바꾼 뒤 텍스트를 생성한다.
핵심 목표는 실제 사용 환경에서 WER(Word Error Rate) 를 낮추는 것이었다. 모델은 처음부터 학습됐고, 연구용 산출물에 그치지 않도록 운영 적합성, 추론 효율, 배포 유연성을 함께 고려했다.
지원 언어는 총 14개다.
- European: English, French, German, Italian, Spanish, Portuguese, Greek, Dutch, Polish
- AIPAC: Chinese(Mandarin), Japanese, Korean, Vietnamese
- MENA: Arabic
성능 면에서는 Hugging Face의 Open ASR Leaderboard에서 **평균 WER 5.42%**로 1위를 기록했다. Cohere는 이 결과가 회의실 음성, 다화자 환경, 다양한 억양처럼 현실적인 조건에서도 유지된다고 강조했다.
비교 대상에는 Whisper Large v3, ElevenLabs Scribe v2, Qwen3-ASR-1.7B 등 공개·비공개 ASR 모델들이 포함됐다. 또한 사람 평가에서도 영어 및 일부 지원 언어에서 전반적으로 우수한 transcript 품질을 보였다고 설명했다.
속도 측면에서도 1B+ parameter급 모델 가운데 높은 throughput(RTFx) 을 유지하며, 정확도와 처리량의 균형을 전면에 내세웠다. 즉, 낮은 WER과 높은 처리 속도를 동시에 겨냥한 포지션이다.
배포 경로도 여러 가지다.
- Hugging Face에서 다운로드 가능
- Cohere API로 무료 실험 가능(레이트 리밋 적용)
- 프로덕션용으로는 Model Vault를 통해 저지연·프라이빗 클라우드 추론 지원
Cohere는 앞으로 North와의 통합을 통해 Transcribe를 단순 전사 모델이 아니라 기업용 speech intelligence의 기반으로 확장하겠다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.