AI Briefing

실시간 다국어 ASR 라우팅 방식 공개

Real-time multilingual ASR using rolling buffers and monolingual models [P]

·2026.06.02 00:53

단일 언어 모델을 라우팅하여 저지연 다국어 음성 인식을 구현하는 새로운 방식을 공개했다.

거대 다국어 모델의 높은 연산 비용과 언어 전환 시의 정확도 문제를 해결하기 위해, 소규모 단일 언어 모델들을 조합하는 라우팅 기반 접근 방식이 제안되었다.

이 시스템은 약 1억 개(100M) 파라미터 규모의 전문화된 단일 언어 모델들을 활용하며, 주요 구성 요소는 다음과 같다:

  • Zipformer: 저지연 스트리밍 전사 수행
  • Silero VAD: 음성 경계 감지
  • SpeechBrain: 언어 식별(LID)

코디네이터가 오디오를 버퍼링하며 언어 신뢰도를 모니터링하다가, 언어 전환이 감지되면 마지막 음성 경계로 **롤백(Rollback)**한 뒤 올바른 모델로 다시 전사하여 정확도를 확보한다.

벤치마크 결과, 문장 간 언어 전환(Inter-utterance switching) 시 **약 13%의 WER(단어 오류율)**을 기록하며 기존 클라우드 API보다 우수한 성능을 보였다. 문장 중간의 언어 전환(Intra-utterance) 시에는 약 41%의 WER을 기록했으나, 여전히 오픈소스 대안들보다 뛰어난 성능을 유지한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.