AI Briefing

마이크로소프트, MAI-Transcribe-2-Streaming으로 Artificial Analysis 1위 달성 및 신규 음성 모델 공개

·2026.10.02 01:00

핵심 내용

마이크로소프트가 Artificial Analysis 1위 MAI-Transcribe-2-Streaming과 신규 음성 모델을 출시했다.

1 / 5

자세히 보기

MAI-Transcribe-2-Streaming 출시 및 성능

Microsoft가 첫 스트리밍 전사 모델 MAI-Transcribe-2-Streaming을 공개했다. Artificial Analysis 벤치마크에서 최종 및 부분 전사 정확도 모두 1위를 기록했다. 60개 언어를 지원하며 자동 연속 언어 감지 기능을 제공한다. 내부 평가에서 가장 가까운 경쟁 모델보다 전사 속도가 2배 빠르다. 올해 말까지 시간당 오디오 0.54달러의 도입 가격으로 제공된다.

MAI-Voice-2.1 및 MAI-Voice-2.1-Flash 공개

전사 모델과 함께 두 개의 새로운 음성 모델이 발표됐다.

  • MAI-Voice-2.1: 23개 언어와 26개 로케일을 지원하는 다국어 텍스트 음성 변환 모델이다. 단일 화자 신원으로도 악센트를 자연스럽게 적응한다. 100만 자당 22달러다.
  • MAI-Voice-2.1-Flash: 대량 처리 및 지연 시간에 민감한 애플리케이션에 최적화됐다. 150ms의 엔드투엔드 지연으로 45초 분량의 오디오를 생성한다. 유사 모델 대비 추론 속도는 55% 빠르고 비용은 약 60% 낮다. 100만 자당 15달러다.

두 음성 모델 모두 동의 가드레일이 적용된 음성 복제 기능을 지원한다.

대화형 AI 루프 최적화 및 가용성

이들 모델은 대화형 AI 루프의 지연 시간을 줄이기 위해 설계됐다. MAI-Voice-2.1과 MAI-Voice-2.1-Flash는 OpenRouter를 통해 이용 가능하며, 세 모델 모두 Microsoft Foundry, MAI Playground, Vercel에서 접근할 수 있다. LiveKit 지원은 곧 추가될 예정이다. MAI Playground에서는 모델들의 협업 시연을 위한 'Chatter' 데모가 제공된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.