AI Briefing

Microsoft VibeVoice: 오픈소스 최전선 음성 AI

·2026.04.28 20:56

Microsoft가 VibeVoice ASR과 Realtime 모델을 오픈소스로 공개했다.

Microsoft의 VibeVoiceTTSASR을 함께 담은 오픈소스 음성 AI 패밀리다. 핵심은 7.5Hz의 continuous speech tokenizer와, LLM이 문맥과 대화 흐름을 이해하고 diffusion head가 음향 디테일을 생성하는 next-token diffusion 구조다.

최근 공개 내용은 다음과 같다.

  • 2026-03-06: VibeVoice-ASR가 Hugging Face Transformers 릴리스에 포함됐다.
  • 2026-01-21: 60분 길이 오디오를 한 번에 처리하는 ASR를 공개했다. 화자(Who), 타임스탬프(When), 내용(What)을 함께 담은 구조화 전사를 만들고, customized hotwords를 지원한다.
  • 50개 이상 언어를 지원하며, 파인튜닝 코드와 vLLM inference 문서도 함께 제공한다.
  • 2025-12-03: 스트리밍 텍스트 입력과 긴 발화를 지원하는 VibeVoice-Realtime-0.5B를 오픈소스로 공개했다.
  • 2025-12-16: 실험용 화자 프리셋을 추가해 독일어·프랑스어·이탈리아어·일본어·한국어 등 9개 언어11개 영어 스타일 음성을 제공했다.
  • 2025-09-05: 책임 있는 사용 이슈로 VibeVoice-TTS 코드를 저장소에서 제거했다.
  • 2025-08-25: 최대 90분, 최대 4화자의 대화형 음성을 합성하는 VibeVoice-TTS를 공개했고, ICLR 2026 Oral로 채택됐다.

모델 목록에는 VibeVoice-ASR-7B, VibeVoice-TTS-1.5B, VibeVoice-Realtime-0.5B가 있으며, Hugging Face 가중치와 Playground, Colab 데모, 파인튜닝 리소스가 함께 제공된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.