추천VibeVoice-ASR-Streaming-7B: 10개 언어 지원, 화자 구분까지 실시간 처리하는 스트리밍 ASR
microsoft/VibeVoice-ASR-Streaming-7B
·2026.09.07 08:29
프로젝트 소개
음성이 들어오는 즉시 누가 무엇을 말했는지 구분해 실시간으로 전사한다. 기존 ASR 모델이 문장 단위로 처리하던 것과 달리, 스트리밍 방식으로 대화 흐름을 끊지 않고 화자 식별까지 수행한다.
한국어를 포함해 영어, 중국어, 일본어 등 10개 언어를 지원한다. 사용자가 지정한 고유명사나 전문 용어를 'Hotwords'로 등록하면 해당 단어의 인식 정확도를 높일 수 있어, 특정 도메인 데이터 처리에 유리하다.
Microsoft Research가 개발한 7B 파라미터 규모의 모델로, MIT 라이선스를 적용해 상업적 활용이 가능하다. Transformers 라이브러리와 호환되며, 실시간 회의록 작성이나 고객 상담 분석 등 화자 구분이 필수적인 작업에 적합하다.
HuggingFace 모델
microsoft/VibeVoice-ASR-Streaming-7B
원문에 등록된 설명이 없습니다.
automatic-speech-recognition
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

