Qwen, 실시간 화자 분리 및 원문-번역 동기화 지원하는 'Qwen3.8-LiveTranslate' 공개
핵심 내용
Qwen이 화자 음색 보존과 원문-번역 동기화 기능을 갖춘 실시간 통역 모델 Qwen3.8-LiveTranslate를 공개했다.
자세히 보기
Qwen 팀이 실시간 동시통역의 정확성과 청취 능력을 강화한 Qwen3.8-LiveTranslate를 발표했다. 이 모델은 오디오와 텍스트를 단일 인터리브드 스트림으로 재구성하는 Interleave architecture를 도입해, 평균 지연(LAAL)을 2.8초에서 2.3초로 단축하고 번역 충실도와 유창성을 개선했다.
핵심 기능 및 아키텍처
모델은 Hybrid-MoE 기반의 Thinker-Talker 2모듈 설계를 채택했다. Thinker는 비디오, 오디오, 원문, 번역을 단일 causal sequence로 처리하며, Talker는 번역과 원본 오디오를 결합해 화자의 음색(timbre)을 안정적으로 보존한 음성을 합성한다. 주요 신규 기능으로는 실시간 화자 분리, 원문과 번역문의 동기화 출력, 그리고 긴 컨텍스트를 활용한 모호성 해소(Long-context disambiguation)가 있다.
성능 및 언어 지원
Omnilingua-MSpeaker 벤치마크에서 기존 시스템 대비 번역 품질과 화자 분리 오류율(DER)에서 우위를 점했으며, FLEURS 벤치마크에서도 70개 언어 방향의 음성 인식 및 합성 품질에서 리드했다. 입력 오디오와 출력 텍스트는 60개 언어를 지원하며, 출력 오디오는 한국어, 영어, 중국어 등 29개 언어를 지원한다.
API 및 활용
DashScope API를 통해 마이크 오디오를 스트리밍하면 서버가 화자 식별자와 원문 텍스트를 번역과 함께 반환하므로 별도의 ASR 인터페이스 호출이 필요 없다. 세션 설정을 통해 화자 분리 및 동기화 출력을 활성화할 수 있으며, 시각적 컨텍스트 전송과 고유명사 정확도 향상을 위한 hotword 등록도 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.