Microsoft VibeVoice: 오픈소스 최전선 음성 AI
·2026.04.28 20:56
핵심 내용
Microsoft가 VibeVoice ASR과 Realtime 모델을 오픈소스로 공개했다.
1 / 2
자세히 보기
Microsoft의 VibeVoice는 TTS와 ASR을 함께 담은 오픈소스 음성 AI 패밀리다. 핵심은 7.5Hz의 continuous speech tokenizer와, LLM이 문맥과 대화 흐름을 이해하고 diffusion head가 음향 디테일을 생성하는 next-token diffusion 구조다.
최근 공개 내용은 다음과 같다.
- 2026-03-06: VibeVoice-ASR가 Hugging Face Transformers 릴리스에 포함됐다.
- 2026-01-21: 60분 길이 오디오를 한 번에 처리하는 ASR를 공개했다. 화자(Who), 타임스탬프(When), 내용(What)을 함께 담은 구조화 전사를 만들고, customized hotwords를 지원한다.
- 50개 이상 언어를 지원하며, 파인튜닝 코드와 vLLM inference 문서도 함께 제공한다.
- 2025-12-03: 스트리밍 텍스트 입력과 긴 발화를 지원하는 VibeVoice-Realtime-0.5B를 오픈소스로 공개했다.
- 2025-12-16: 실험용 화자 프리셋을 추가해 독일어·프랑스어·이탈리아어·일본어·한국어 등 9개 언어와 11개 영어 스타일 음성을 제공했다.
- 2025-09-05: 책임 있는 사용 이슈로 VibeVoice-TTS 코드를 저장소에서 제거했다.
- 2025-08-25: 최대 90분, 최대 4화자의 대화형 음성을 합성하는 VibeVoice-TTS를 공개했고, ICLR 2026 Oral로 채택됐다.
모델 목록에는 VibeVoice-ASR-7B, VibeVoice-TTS-1.5B, VibeVoice-Realtime-0.5B가 있으며, Hugging Face 가중치와 Playground, Colab 데모, 파인튜닝 리소스가 함께 제공된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.