AI Briefing

Qwen3-ASR와 Qwen3-ForcedAligner 오픈소스 공개: 견고한 스트리밍 다국어 지원

·2026.01.29 01:00

Qwen3-ASR와 ForcedAligner를 오픈소스로 공개해 다국어·스트리밍 음성 인식을 강화했다.

Qwen3-ASR 가족은 Qwen3-ASR-1.7B, Qwen3-ASR-0.6B, 그리고 Qwen3-ForcedAligner-0.6B로 구성된다. 두 ASR 모델은 언어 식별과 음성 인식을 하나의 모델로 처리하며, 30개 언어와 22개 중국 방언, 여러 국가의 영어 억양까지 포괄한다.

1.7B 버전은 공개 ASR 모델 중 최상위 성능을 목표로 했고, 내부 평가에서는 상용 API와도 경쟁 가능한 결과를 냈다. 0.6B 버전은 정확도와 효율의 균형에 초점을 맞췄으며, concurrency 128 환경에서 2,000초 분량의 음성을 1초에 처리하고, time-to-first-token은 92ms까지 낮출 수 있다고 밝혔다.

  • 지원 범위: speech, singing voice, songs with BGM
  • 추론 방식: offline / streaming 통합, 단일 모델로 최대 20분 길이의 음성 처리
  • 프레임워크: vLLM 기반 batch inference, asynchronous serving, streaming inference, timestamp prediction 지원
  • 라이선스: Apache 2.0

Qwen3-ForcedAligner-0.6B는 비자기회귀형(NAR) timestamp predictor로, 최대 5분 길이의 음성에서 텍스트-음성 정렬을 수행한다. 11개 언어를 지원하며, 평가에서는 Nemo-Forced-Aligner, WhisperX, Monotonic-Aligner보다 더 높은 timestamp accuracy와 효율성을 보였다고 설명한다.

성능 평가는 영어, 다국어, 중국어·방언, 까다로운 음향 조건, 노래 전사까지 폭넓게 진행됐다. 영어 내부 테스트셋에서는 GPT-4o Transcribe, Gemini, Doubao ASR, Whisper-large-v3보다 우수하다고 주장했고, 다국어와 중국어·방언 영역에서도 공개 모델 대비 강한 결과를 내세웠다.

세 모델의 가중치와 함께 강력한 inference-finetune framework도 공개했으며, 이를 통해 ASR과 오디오 이해 연구를 더 빠르게 확산시키겠다는 목표를 제시했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.