AI Briefing

Qwen3-TTS 패밀리 오픈소스 공개: 음성 디자인, 클론, 생성

·2026.01.22 01:00

Qwen3-TTS가 1.7B·0.6B 라인업으로 공개돼 음성 디자인·클론·스트리밍 생성을 지원한다.

Qwen3-TTS 패밀리가 오픈소스로 공개됐다. Voice Design, Voice Clone, 고품질 음성 생성과 자연어 기반 음성 제어를 하나의 계열로 묶었고, 1.7B0.6B 두 크기로 출시됐다.

핵심은 Qwen3-TTS-Tokenizer-12Hz 기반의 다중 codebook speech encoder와 Dual-Track 하이브리드 스트리밍 구조다. 이를 통해 음성 신호를 효율적으로 압축·표현하면서도, 비-DiT 경량 구조로 고속·고충실도 복원이 가능하며, 첫 오디오 패킷은 단일 문자 입력 후 바로 출력되고 end-to-end 지연은 97ms까지 낮아진다.

모델 구성은 기능별로 나뉜다.

  • Qwen3-TTS-12Hz-1.7B-VoiceDesign: 사용자 설명으로 음색을 설계
  • Qwen3-TTS-12Hz-1.7B-CustomVoice: 지시문으로 9개 프리미엄 timbre를 제어
  • Qwen3-TTS-12Hz-1.7B-Base: 3초 음성으로 빠른 voice clone 및 파인튜닝용 베이스
  • Qwen3-TTS-12Hz-0.6B-CustomVoice / Base: 더 가벼운 균형형 라인업

지원 언어는 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어의 10개 주요 언어이며, 다양한 방언도 포함한다. 자연어 지시를 통해 timbre, emotion, prosody를 조절하고, 텍스트 의미를 반영해 톤과 리듬을 적응적으로 바꾼다.

평가 결과도 강하다. Voice design에서는 MiniMax-Voice-Design 폐쇄형 모델보다 InstructTTS-Eval에서 instruction-following과 표현력 모두 앞섰고, voice control에서는 평균 **WER 2.34%**와 style control **75.4%**를 기록했다. 10분 연속 합성에서는 중국어 WER 2.36%, 영어 **2.81%**를 보였고, voice clone에서는 10개 언어 평균 WER 1.835%, speaker similarity 0.789MiniMaxElevenLabs를 앞섰다.

토크나이저도 별도로 강한 성능을 보였다. LibriSpeech test-clean 기준으로 PESQ 3.21/3.68, STOI 0.96, UTMOS 4.16, speaker similarity 0.95를 기록하며, speech reconstruction 품질과 화자 정보 보존에서 SOTA 수준을 제시했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.