AI Briefing

Voxtral은 음성의 속도로 전사한다

·2026.02.04 09:00

Mistral이 13개 언어를 지원하는 Voxtral Transcribe 2와 실시간 모델을 공개했다.

Voxtral Transcribe 2는 고정밀 화자 분리(diarization), 실시간 전사, 초저지연을 목표로 한 두 개의 speech-to-text 모델이다. 제품군은 배치 전사용 Voxtral Mini Transcribe V2와 라이브 앱용 Voxtral Realtime로 나뉜다.

Voxtral Realtime는 오프라인 모델을 조각내 처리하는 방식이 아니라, 오디오가 들어오는 즉시 전사하는 스트리밍 아키텍처를 사용한다. 지연 시간은 sub-200ms까지 설정할 수 있고, 2.4초 지연에서는 자막용으로 적합한 수준의 품질을 보이며, 480ms에서도 word error rate 손실을 1~2% 수준으로 유지한다고 밝혔다.

언어 지원은 영어, 중국어, 힌디어, 스페인어, 아랍어, 프랑스어, 포르투갈어, 러시아어, 독일어, 일본어, 한국어, 이탈리아어, 네덜란드어까지 13개 언어다. 4B 파라미터 규모로 설계돼 엣지 장치에서도 효율적으로 구동되며, 공개된 가중치는 Apache 2.0 라이선스로 배포된다.

Voxtral Mini Transcribe V2는 배치 전사에 초점을 맞춘 모델로, 다음 기능을 제공한다.

  • Speaker diarization: 누가 언제 말했는지 화자 라벨과 시작/종료 시각을 함께 제공
  • Context biasing: 이름, 기술 용어, 도메인별 표현을 맞추도록 최대 100개 단어 또는 구문을 지정
  • Word-level timestamps: 단어별 정밀 타임스탬프 제공
  • Noise robustness: 공장, 콜센터, 현장 녹음 같은 환경에서도 강한 성능
  • Longer audio support: 한 번에 최대 3시간 분량 처리

성능과 가격도 강조했다. Mini Transcribe V2는 FLEURS 기준 약 4% word error rate, $0.003/min 수준으로, GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal, Deepgram Nova보다 정확도가 높고, ElevenLabs Scribe v2보다 약 3배 빠르면서 비용은 5분의 1이라고 설명한다.

Mistral은 새로 연 audio playground도 공개했다. Mistral Studio에서 오디오를 업로드해 diarization, 타임스탬프 granularity, context bias term을 바로 시험할 수 있으며, 최대 10개 파일, 파일당 1GB, 형식은 .mp3, .wav, .m4a, .flac, .ogg를 지원한다.

적용처는 분명하다. 회의 기록, 음성 에이전트, 컨택센터 자동화, 라이브 자막, 규제 준수와 감사 추적까지, 낮은 지연과 화자 분리가 필요한 음성 워크플로를 더 저렴하고 빠르게 만들겠다는 방향이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.