Qwen3-TTS의 진화: 음성 복제와 음성 설계!
·2025.12.23 01:00
핵심 내용
Qwen3-TTS가 자연어 음성 설계와 3초 음성 복제를 지원한다.
자세히 보기
Qwen3-TTS 패밀리가 두 개의 새 모델을 내놨다. Qwen3-TTS-VD-Flash는 자연어 지시만으로 음색, 운율, 감정, 페르소나를 세밀하게 조절하는 voice design 모델이고, Qwen3-TTS-VC-Flash는 3초 음성 복제를 지원하는 voice cloning 모델이다.
- VD-Flash는 “무엇을 말할지”뿐 아니라 “어떻게 말할지”까지 제어하도록 설계됐다.
- InstructTTS-Eval에서 GPT-4o-mini-tts와 Mimo-audio-7b-instruct를 종합적으로 앞섰고, 역할극 테스트에서는 Gemini-2.5-pro-preview-tts보다 우수했다고 밝혔다.
- VC-Flash는 중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어 등 10개 주요 언어로 복제 음성 기반 합성을 지원한다.
- MiniMax TTS Multilingual Test Set에서는 평균 WER가 MiniMax, ElevenLabs, GPT-4o-Audio-Preview보다 더 좋다고 설명한다.
두 모델 모두 표현력이 높고 사람 같은 음성을 지향한다. 입력 텍스트의 의미에 맞춰 억양과 리듬을 자동 조정하며, 복잡한 문장 구조나 비정형 텍스트도 안정적으로 처리한다.
또한 사용자는 생성한 음성을 저장해 반복 호출할 수 있어, 다중 화자·다중 턴의 장문 대화에도 활용할 수 있다. 본문에는 Qwen API로 qwen-voice-design을 호출해 음성 프로필을 만드는 예시 코드도 함께 제시된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.