Hugging Face, Open TTS Leaderboard 공개
Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning
핵심 내용
Hugging Face가 WER와 RTFx 등 객관적 지표로 오픈소스 TTS 모델을 평가하는 Open TTS Leaderboard를 출시했다.
자세히 보기
Hugging Face가 급증하는 오픈소스 TTS 모델 평가의 단편화 문제를 해결하기 위해 Open TTS Leaderboard를 출시했다. 2026년 9월 30일 기준 Hub에 등록된 TTS 모델은 8K를 넘어서지만, 기존 아레나 방식 리더보드는 호스팅 복잡성과 투표자 불일치로 인해 오픈 웨이트 모델을 충분히 반영하지 못하는 한계가 있었다.
객관적 지표와 속도
이 리더보드는 인간 선호도 기반 아레나와 달리 객관적 지표를 활용해 모델 평가 시간을 몇 주에서 몇 시간으로 단축했다. 주요 지표는 다음과 같다:
- 명료성(Intelligibility): Qwen3 ASR을 사용해 측정하는 단어 및 문자 오류율(WER/CER).
- 속도(Speed): 배치 오프라인 추론을 위한 역 실시간 계수(RTFx)와 H200 GPU 및 CPU에서의 스트리밍 지연 시간을 위한 첫 오디오 생성 시간(TTFA).
- 화자 유사성(Speaker Similarity): 생성된 오디오와 참조 클립의 WavLM 화자 임베딩 간 코사인 유사도.
다국어 및 음성 클로닝 지원
이 리더보드는 영어 전용 지표가 한계를 보이는 다국어 성능과 음성 클로닝에 중점을 둔다. 모델은 Seed TTS Eval 및 CV3 Eval 데이터셋으로 순위가 매겨진다. 영어 WER 기준 상위 모델은 hexgrad/Kokoro-82M, Supertone/supertonic-3, fishaudio/s2-pro이다. 다국어 작업에서는 k2-fsa/OmniVoice, fishaudio/s2-pro, FunAudioLLM/Fun-CosyVoice3-0.5B-2512가 뛰어난 성과를 보인다. 음성 클로닝 기능은 참조 오디오 제공 시 성능이 향상되는 bosonai/higgs-tts-3-4b 및 openbmb/VoxCPM2 같은 모델 비교를 가능하게 한다.
커뮤니티 및 스트리밍
플랫폼에는 사용자가 생성된 출력을 비교하고 투표할 수 있는 "Listen" 탭이 포함되어 향후 순위 결정에 커뮤니티 피드백을 통합할 계획이다. 전용 Streaming 탭은 TTFA 기준으로 모델을 순위화하며, GPU와 CPU 모두에서 낮은 지연 시간을 보이는 kyutai/pocket-tts를 상위 모델로 강조한다. Hugging Face는 GitHub를 통해 커뮤니티 기여를 장려하기 위해 평가 스크립트를 오픈소스로 공개할 예정이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.