AI Briefing

VibeVoice - 오픈소스 프론티어 음성 AI 모델

·2026.04.28 13:09

Microsoft가 VibeVoice를 공개해 ASR·TTS·실시간 음성 모델 패밀리를 선보였다.

Microsoft가 VibeVoice를 오픈소스 음성 AI 모델 패밀리로 공개했다. ASRTTS를 함께 제공하며, 7.5Hz 초저 프레임 레이트 연속 음성 토크나이저와 next-token diffusion을 결합해 긴 오디오 처리 효율을 높인다.

  • **VibeVoice-ASR (7B)**는 최대 60분 오디오를 단일 패스로 처리한다.

  • Whisper처럼 작동하지만 speaker diarization이 모델에 내장돼 있고, 출력은 Who / When / What 구조로 정리된다.

  • 사용자 지정 hotword를 지원하며 50개 이상 언어를 네이티브로 지원한다.

  • 2026년 3월부터 Hugging Face Transformers에 통합됐고, vLLM 추론과 파인튜닝 코드도 공개됐다.

  • **VibeVoice-TTS (1.5B)**는 최대 90분 대화형 음성을 한 번에 생성하고, 최대 4명 화자를 지원한다.

  • 감정적 뉘앙스와 대화 역학을 반영한 자연스러운 음성을 목표로 한다.

  • 다만 의도와 다른 사용 사례가 확인돼 2025년 9월 5일 TTS 코드가 저장소에서 제거됐다.

  • **VibeVoice-Realtime (0.5B)**는 최대 10분 길이의 실시간 TTS용 모델이다.

  • 첫 음성 출력까지 약 300ms가 걸리며, 스트리밍 텍스트 입력을 지원한다.

  • 2025년 12월 16일 기준 9개 언어11개 영어 스타일 음성이 실험적으로 추가됐다.

  • Gradio ASR 데모에는 Apple Silicon(MPS) 지원도 추가됐다.

베이스 모델이 Qwen2.5 1.5B라 편향과 오류를 상속할 수 있고, 딥페이크 악용 위험도 남아 있다. 라이선스는 MIT다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.