AI Briefing

Meta, 실시간 다국어 ASR 모델 'Muse Voice Transcribe' 공개… WER 3.1%로 벤치마크 1위

·2026.09.02 09:00

핵심 내용

Meta가 실시간 스트리밍 ASR 모델 'Muse Voice Transcribe'를 공개하며 WER 3.1%로 벤치마크 1위를 기록했다.

1 / 2

자세히 보기

Meta Superintelligence Labs가 실시간 오디오 인식 모델 Muse Voice Transcribe를 공개했다. 이 모델은 실시간 스트리밍 ASR, 화자 구분(diarization), 엔드포인팅(endpointing)을 지원하며, 20명 이상의 화자를 정확히 분리할 수 있다. Artificial Analysis 벤치마크에서 스트리밍 speech-to-text 및 공개 diarization 부문 1위를 차지했다.

성능 및 벤치마크

최종 전사 단어 오류율(WER)은 **3.1%**로, 경쟁 시스템(3.4~4.0%) 대비 낮은 수치를 기록했다. 평균 화자 구분 오류율(DER)은 **17.5%**로 기존 시스템(21.1~28.6%)보다 우수하다. 특히 8명이 동시에 대화하는 복잡한 환경에서도 실시간으로 화자를 추적하는 데 성공했다.

핵심 기술: 적응형 지연(Adaptive Delay)

정확도와 지연(latency) 사이의 트레이드오프를 해결하기 위해 적응형 지연(adaptive delay) 기술을 적용했다. 단어의 난이도에 따라 지연 시간을 동적으로 조절하며, 강화 학습(RL)을 통해 WER 보상과 지연 보상을 최적화했다. 이를 통해 0.16초 시점에 약 3.0%의 오류율을 달성하며 파레토 프론트(Pareto front)를 형성했다.

다국어 및 코드 스위칭 지원

25개 이상의 언어를 네이티브로 처리하며, 한 문장 내에서의 자연스러운 **코드 스위칭(code-switching)**을 완벽하게 인식한다. 컨텍스트 바이어싱(context biasing) 기능을 통해 Meta, Menlo Park 등 특정 키워드나 사용자 맥락을 정확히 파악한다. 오디오는 전사 생성에만 사용되며 저장되지 않아 프라이버시를 보호한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.