AI Briefing

HuggingFace, TTS Arena 공개

TTS Arena: Benchmarking Text-to-Speech Models in the Wild

·2024.02.27 09:00

HuggingFace가 인간의 선호도를 기반으로 TTS 모델의 품질을 비교하는 TTS Arena를 출시했다.

텍스트 음성 변환(TTS) 모델의 자연스러움과 억양을 측정하는 것은 기존의 WER(Word Error Rate) 같은 자동화된 지표만으로는 한계가 있습니다. 이를 해결하기 위해 HuggingFace는 LMSys의 Chatbot Arena에서 영감을 받은 TTS Arena를 발표했습니다.

TTS Arena는 사용자가 텍스트를 입력하면 두 개의 서로 다른 모델이 생성한 음성을 들려주고, 사용자가 더 자연스러운 음성에 투표하는 방식으로 운영됩니다. 투표 결과는 체스나 게임에서 사용되는 Elo rating system을 통해 순위가 매겨지며, 이를 통해 커뮤니티 기반의 신뢰할 수 있는 리더보드를 구축합니다.

현재 출시 단계에서 포함된 주요 모델은 다음과 같습니다:

  • Proprietary: ElevenLabs
  • Open-source: MetaVoice, OpenVoice, Pheme, WhisperSpeech, XTTS

이 플랫폼은 오픈 소스 모델과 상용 모델 간의 성능을 직접 비교할 수 있는 환경을 제공하여, 개발자들이 더 나은 모델을 선택하고 비교할 수 있도록 돕는 것을 목표로 합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.