AI Briefing

Qwen3.5-LiveTranslate: 소리에서 시각으로, 번역은 더 정확하게

·2026.05.19 18:40

Qwen이 시각 맥락까지 활용하는 실시간 통역 모델 Qwen3.5-LiveTranslate를 공개했다.

Qwen3.5-LiveTranslate-FlashQwen3.5-Omni 기반의 최신 동시통역 모델로, 음성뿐 아니라 시각 맥락까지 함께 읽어 번역 정확도를 높인다. 국제회의, 라이브 스트리밍, 온라인 수업, 비즈니스 협상 같은 다국어 환경을 겨냥했다.

핵심 업그레이드는 다음과 같다.

  • 입력 오디오/출력 텍스트 언어: 18개 → 60개
  • 출력 음성 언어: 10개 → 29개
  • 평균 speech-to-speech per-token latency: 2.8초
  • 음성 복제: pre-registered / clone-once / real-time 3모드
  • Hotword: 최대 1,000개 고유명사·전문용어 우선 처리

실시간 성능은 Readable Unit 스트리밍으로 끌어올렸다. 전작인 Qwen3-LiveTranslate-Flash 대비 첫 토큰 지연은 3.45초, 토큰당 지연은 1.88초 줄었고, 번역 품질 저하는 거의 없다고 설명한다.

오프라인 평가에서는 FLEURSCoVoST2에서 주류 상용 대형 음성 모델보다 높은 정확도를 보였고, 전작보다 언어 커버리지와 번역 품질이 모두 개선됐다. 아키텍처는 Thinker-Talker 구조를 사용해 Thinker가 오디오·이미지 입력으로 텍스트 번역을 만들고, Talker가 원문 음성과 번역 텍스트로 크로스링구얼 음성 복제를 생성한다.

데모는 국제회의, 해외 여행, 이커머스 라이브, 고전 중국어 번역, 시각적 중의성 해소를 보여줬다. 회사는 앞으로 더 낮은 지연, 더 많은 언어·방언, 긴 문맥 일관성, 더 자연스러운 음성 복제, 제스처·입모양·표정까지 아우르는 상호작용 모드를 확장하겠다고 밝혔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.