Zyphra, 오픈소스 실시간 TTS 'ZONOS2' 공개
ZONOS2: real-time TTS with 8B params, 900M active, and high-fidelity voice cloning
·2026.06.13 17:33
Zyphra가 고정밀 음성 클로닝과 실시간 추론이 가능한 오픈소스 MoE 기반 TTS 모델 ZONOS2를 출시했다.
Zyphra가 차세대 실시간 텍스트 음성 변환(TTS) 모델인 ZONOS2를 공개했습니다. 이 모델은 Apache 2.0 라이선스로 제공되는 오픈소스 모델로, 품질과 속도 사이의 트레이드오프를 해결하도록 설계되었습니다.
주요 기술적 특징:
- Sparse MoE(Mixture of Experts) 구조: 총 8B 파라미터를 보유하고 있으나, 추론 시에는 900M의 활성 파라미터만 사용하여 효율성을 극대화했습니다.
- 고정밀 오디오 생성: Descript Audio Codec(DAC) 토큰을 예측하여 44.1 kHz 스튜디오 품질의 오디오를 생성합니다.
- 언어 지원 및 코드 스위칭: 별도의 포네마이저(Phonemizer) 없이 raw UTF-8 바이트를 직접 읽어 처리함으로써 한국어, 중국어, 일본어 등 저자원 언어 성능을 높이고 문장 중간의 **코드 스위칭(Code-switching)**을 지원합니다.
- Zero-shot 클로닝: 추가적인 파인튜닝 없이도 화자의 고유한 특성을 포착하는 강력한 음성 클로닝 성능을 제공합니다.
ZONOS2는 약 600만 시간 이상의 대규모 오디오 데이터를 통해 학습되었으며, 기존의 주요 TTS 모델(Qwen 3 TTS, Cartesia Sonic 3.5 등) 대비 우수한 Prosody(운율) 점수를 기록하며 높은 표현력을 입증했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.