마이크로소프트, 초고속 음성 전사 모델 MAI-Transcribe-2 공개
Microsoft, 1시간분량 오디오를 10초만에 전사하는 60개 언어 음성 인식 모델 MAI-Transcribe-2 출시 (가중치 공개 X)
핵심 내용
마이크로소프트가 60개 언어를 지원하고 1시간 분량 오디오를 10초 만에 전사하는 MAI-Transcribe-2를 공개했다.
자세히 보기
마이크로소프트 AI(MAI)가 60개 언어를 지원하고 1시간 분량의 오디오를 10초 만에 처리하는 음성 인식 모델 MAI-Transcribe-2를 공개했다. 가중치는 공개되지 않으며 호스팅 API 전용으로 제공된다.
성능 및 벤치마크
이전 버전(MAI-Transcribe-1.5) 대비 언어 지원이 17개 늘었으며, 화자 분리(Speaker Diarization)와 단어 단위 타임스탬프 지원이 추가되었다. Artificial Analysis 리더보드에서 WER(단어 오류율) **2.04%**로 2위를 기록했으며, 추론 지연은 20초에서 10초로 단축되었다. 특히 속도 계수에서 GPT-Transcribe 대비 11.41배, Gemini 3.5 Transcribe 대비 4.56배 빠른 처리 속도를 보인다.
가격 및 배포
현재 오디오 1시간당 $0.10의 프로모션 가격이 적용되며(정상가 미공개), Azure Speech 공개 프리뷰로 배포된다. 다만 SLA가 적용되지 않아 프로덕션 환경 사용은 권장되지 않는다. 한국어 FLEURS 기준 WER는 **3.4%**로 Gemini 3.1 Pro(3.3%)와 유사한 성능을 보인다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.