AI Briefing

마이크로소프트, VibeVoice 공개

microsoft/VibeVoice

·2026.04.28 08:46

핵심 내용

마이크로소프트의 VibeVoice로 1시간 음성을 8분 45초에 전사했다.

자세히 보기

마이크로소프트가 VibeVoice-ASR를 공개했다. Whisper 계열의 음성 인식 모델이며 speaker diarization 기능이 내장돼 있고 MIT 라이선스로 배포된다.

128GB M5 Max MacBook Pro에서 uv와 mlx-audio를 써서 mlx-community/VibeVoice-ASR-4bit(5.71GB) MLX 변환본을 돌렸다. 원본 VibeVoice-ASR 모델은 17.3GB이며, --max-tokens 32768로 99.8분짜리 팟캐스트의 처음 1시간을 JSON 세그먼트로 전사했다.

성능은 다음과 같다.

  • 524.79초로 1시간 오디오를 처리했다.
  • 도구 출력상 피크 메모리는 30.44GB였다.
  • Activity Monitor에서는 prefill 단계에 61.5GB, 생성 단계에 약 18GB가 보였다.

제약도 분명했다.

  • 기본 --max-tokens 값은 8192라 약 25분 분량에 그쳤다.
  • .wav와 .mp3는 모두 정상 동작했지만, VibeVoice 자체는 최대 1시간까지만 처리한다.
  • 더 긴 파일은 겹침을 둔 분할과 화자 ID 정렬이 필요하다.

결과 JSON은 speaker_id를 포함한 배열이라 Datasette Lite에서 쉽게 탐색할 수 있었다. 흥미롭게도 세 명의 화자가 잡혔는데, 대화의 두 사람 외에 스폰서 읽기용 별도 Lenny 음성이 따로 분리됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.