AI Briefing

Sopro V2, 경량 TTS 공개

Sopro V2: SOTA-level voice cloning TTS at 120M params, open-source and CPU-friendly

·2026.08.27 23:38

핵심 내용

1.2억 파라미터 오픈소스 TTS Sopro V2가 SOTA급 음성 복원 성능을 내며 CPU에서도 고속 추론이 가능해졌다.

자세히 보기

1.2억 파라미터 규모의 오픈소스 TTS 모델 Sopro V2가 공개되었다. Apache-2.0 라이선스를 적용했으며, 5~20초의 참조 오디오만으로 제로샷 음성 복원이 가능하다.

성능 및 기술적 특징

  • Seed-TTS-eval 테스트에서 영어 WER 1.51~1.65를 기록해, F5-TTS(1.83), CosyVoice 3(2.02) 등 3~14배 큰 모델들과 경쟁할 만한 성능을 보였다.
  • CPU 추론 최적화되어 M3 CPU에서 첫 오디오 생성까지 약 300ms(0.21 RTF)가 소요되며, H100에서는 0.07 RTF의 고속 스트리밍을 지원한다.
  • 영어, 유럽 포르투갈어, 프랑스어, 독일어를 지원하며, 유럽 포르투갈어를 네이티브로 지원하는 첫 오픈 TTS 모델이다.

배포 및 사용

  • uvx --from sopro soprotts serve 명령 하나로 로컬에서 웹 UI를 실행할 수 있다.
  • GitHub, Hugging Face, PyPI를 통해 모델 가중치와 코드가 공개되어 있으며, 브라우저 기반 데모도 제공된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.