AI Briefing

Voxtral 이야기

·2026.03.23 09:00

Mistral이 4B Voxtral TTS를 공개, 9개 언어 고품질 음성과 저지연을 내세웠다.

Voxtral TTS는 Mistral의 첫 text-to-speech 모델로, 다국어 음성 생성에서 최상급 성능을 목표로 한다. 4B 파라미터 규모로 설계돼, 자연스럽고 신뢰할 수 있으며 대규모 운영에 적합한 비용 구조를 강조한다.

핵심은 단순한 낭독이 아니라 맥락 이해화자 모델링이다. 감정, 억양, 멈춤, 리듬, 발화 습관까지 반영해 더 사람 같은 음성을 만들며, 기업이 자신만의 voice AI stack을 직접 통제할 수 있도록 설계됐다.

주요 특징은 다음과 같다.

  • 9개 언어 지원: English, French, German, Spanish, Dutch, Portuguese, Italian, Hindi, Arabic
  • 다양한 dialect와 감정 표현 지원
  • time-to-first-audio가 매우 짧은 저지연 스트리밍
  • 3초 정도의 레퍼런스로도 커스텀 보이스 적응 가능
  • Mistral Studio에서 바로 테스트 가능

성능 측면에서 Mistral은 네이티브 화자 기준의 human evaluation이 자동 지표보다 중요하다고 본다. 비교 평가에서 Voxtral TTS는 ElevenLabs Flash v2.5보다 자연스러움이 우수했고, TTFA는 비슷한 수준을 유지했으며, ElevenLabs v3와는 품질이 동급이라고 설명했다. 특히 zero-shot custom voice 환경에서 9개 언어의 대표 음성을 대상으로 자연스러움, 억양 적합성, 원본과의 acoustic similarity를 비교해 더 큰 품질 격차를 보였다고 밝혔다.

아키텍처는 transformer-based autoregressive flow-matching model이며, Ministral 3B 위에 구축됐다. 구성은 3.4B parameter transformer decoder backbone, 390M flow-matching acoustic transformer, 300M neural audio codec로 이뤄진다. 음성 프롬프트는 5~25초 길이를 사용하며, 각 오디오 프레임마다 semantic token을 예측한 뒤 flow-matching transformer가 16 NFEs로 acoustic latent를 생성한다.

저지연 스트리밍도 강점이다. 일반적인 입력인 10초 음성 샘플500자 텍스트 기준으로 70ms 모델 지연과 약 9.7x RTF를 제시하며, 최대 2분까지는 모델이 직접 생성하고 더 긴 구간은 API의 스마트 interleaving으로 처리한다.

기업 활용 사례로는 고객센터가 대표적이다. Voxtral TTS는 Voxtral Transcribe와 함께 speech-to-speech 파이프라인을 완성하거나, 기존 speech-to-text 및 LLM 스택에 결합해 다국어 지원 voice agent를 구현할 수 있다. API 가격은 1,000자당 $0.016이며, open weights 버전도 Hugging Face에서 제공된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.