방언까지 구사하는 Qwen-TTS
핵심 내용
Qwen-TTS가 중국어 3개 방언과 중영 이중언어 음성을 지원한다.
자세히 보기
Qwen-TTS의 최신 버전인 qwen-tts-latest(또는 qwen-tts-2025-05-22)가 공개됐다. 대규모 음성 데이터로 학습돼 사람에 가까운 자연스러움과 표현력을 목표로 하며, 입력 문장에 맞춰 운율·속도·감정 억양을 자동으로 조절한다.
가장 눈에 띄는 변화는 중국어 방언 지원이다. 현재는 북경어(Pekingese), 상하이어(Shanghainese), 쓰촨어(Sichuanese) 3종 방언을 생성할 수 있다.
지원 음성은 총 7개다.
- 중국어-영어 이중언어 음성: Cherry, Ethan, Chelsie, Serena
- 방언 음성: Dylan(북경어), Jada(상하이어), Sunny(쓰촨어)
성능 측면에서는 SeedTTS-Eval 기준 결과도 함께 제시됐다. Chelsie, Serena, Ethan, Cherry에 대해 WER와 SIM을 공개했으며, 예를 들면 Cherry는 zh WER 1.209, en WER 1.967, hard WER 6.069과 함께 zh SIM 0.799, en SIM 0.664, hard SIM 0.801을 기록했다.
사용 방법도 단순하다. Qwen API에서 dashscope.audio.qwen_tts.SpeechSynthesizer.call()을 호출해 음성을 합성하고, 반환된 오디오 URL을 requests로 내려받는 방식이다. 예시 코드는 DASHSCOPE_API_KEY 환경변수를 읽어 voice="Dylan", model="qwen-tts-latest"로 합성한 뒤 WAV 파일로 저장한다.
핵심은 Qwen-TTS가 단순한 TTS를 넘어, 중영 이중언어와 중국어 방언까지 아우르는 표현형 음성 모델로 확장됐다는 점이다. 향후 더 많은 언어와 스타일 옵션도 추가될 예정이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.