VibeVoice - 오픈소스 프론티어 음성 AI 모델
Microsoft가 VibeVoice를 공개해 ASR·TTS·실시간 음성 모델 패밀리를 선보였다.
Microsoft가 VibeVoice를 오픈소스 음성 AI 모델 패밀리로 공개했다. ASR과 TTS를 함께 제공하며, 7.5Hz 초저 프레임 레이트 연속 음성 토크나이저와 next-token diffusion을 결합해 긴 오디오 처리 효율을 높인다.
-
**VibeVoice-ASR (7B)**는 최대 60분 오디오를 단일 패스로 처리한다.
-
Whisper처럼 작동하지만 speaker diarization이 모델에 내장돼 있고, 출력은 Who / When / What 구조로 정리된다.
-
사용자 지정 hotword를 지원하며 50개 이상 언어를 네이티브로 지원한다.
-
2026년 3월부터 Hugging Face Transformers에 통합됐고, vLLM 추론과 파인튜닝 코드도 공개됐다.
-
**VibeVoice-TTS (1.5B)**는 최대 90분 대화형 음성을 한 번에 생성하고, 최대 4명 화자를 지원한다.
-
감정적 뉘앙스와 대화 역학을 반영한 자연스러운 음성을 목표로 한다.
-
다만 의도와 다른 사용 사례가 확인돼 2025년 9월 5일 TTS 코드가 저장소에서 제거됐다.
-
**VibeVoice-Realtime (0.5B)**는 최대 10분 길이의 실시간 TTS용 모델이다.
-
첫 음성 출력까지 약 300ms가 걸리며, 스트리밍 텍스트 입력을 지원한다.
-
2025년 12월 16일 기준 9개 언어와 11개 영어 스타일 음성이 실험적으로 추가됐다.
-
Gradio ASR 데모에는 Apple Silicon(MPS) 지원도 추가됐다.
베이스 모델이 Qwen2.5 1.5B라 편향과 오류를 상속할 수 있고, 딥페이크 악용 위험도 남아 있다. 라이선스는 MIT다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.