AI Briefing

Qwen3-TTS 업데이트! 49개 음색 + 10개 언어 + 9개 방언

·2025.12.05 01:00

핵심 내용

Qwen3-TTS-Flash가 49개 음색과 10개 언어, 9개 방언을 지원한다.

자세히 보기

Qwen3-TTS-Flash가 다중 음색, 다국어, 다방언 음성 합성을 지원하는 플래그십 text-to-speech 모델로 업데이트됐다. 자연스럽고 표현력 있는 음성을 목표로 하며 Qwen API를 통해 사용할 수 있다.

가장 큰 변화는 49개 이상의 고품질 음색이다. 성별, 연령, 지역적 특징, 캐릭터 성격을 아우르는 다양한 보이스를 제공하며, Momo, Ono Anna, Vivian, Elias, Eldric Sage, Bunny 같은 개성 있는 역할 예시를 제시한다.

언어와 방언 지원도 크게 넓어졌다.

  • 10개 주요 언어: 중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어
  • 9개 방언: Mandarin, Hokkien, Wu, Cantonese, Sichuanese, Beijing, Nanjing, Tianjin, Shaanxi
  • MiniMax TTS 다국어 테스트 세트에서 MiniMax, ElevenLabs, GPT-4o-Audio-Preview보다 낮은 평균 WER를 기록했다고 밝혔다.

또한 이전 버전보다 텍스트에 맞춰 말 빠르기와 운율(prosody) 을 더 유연하게 조정해, 사람 목소리에 더 가까운 자연스러운 발화를 구현했다고 설명한다. 예시 샘플은 중국어, 영어, 일본어, 한국어 등 여러 언어와 지역 방언의 발화 스타일을 보여주며, 실제 사용자 시나리오에 맞춘 감정 표현과 억양 차이를 강조한다.

사용 방법은 DashScope SDK를 설치한 뒤 dashscope.MultiModalConversation.call(...) 형태로 호출하는 방식이다. 모델명은 qwen3-tts-flash-2025-11-27을 사용하며, voice, language_type, stream 같은 파라미터로 음색과 언어를 지정하고, 반환된 audio.url에서 WAV 파일을 내려받을 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.