Breeze-TTS-2: H100 기준 40ms 첫 오디오, 비공개 TTS 성능 상회
BreezeBlue/Breeze-TTS-2
프로젝트 소개
Breeze TTS 2는 실시간 상호작용을 목표로 한 오픈웨이트 텍스트-음성 변환 모델이다. Artificial Analysis TTS 리더보드에서 오픈웨이트 모델 1위를 기록하며, 일부 비공개 프런티어 시스템을 능가하는 성능을 보인다. 단일 모델로 영어와 중국어 음성을 자연스럽게 생성한다.

참조 오디오 없이 자연어 설명만으로 특정한 목소리를 만드는 Voice Design과, 기존 목소리를 유지하면서 톤이나 감정, 속도를 지시하는 Voice Direction을 지원한다. 텍스트 안에 (laugh)나 [笑] 같은 표기만 넣으면 웃음, 기침, 목청 등 표현적인 발성 이벤트를 자동으로 삽입한다.
NVIDIA H100 환경에서 워밍업된 패스트 패스를 사용할 때 첫 오디오 도달 시간(TTFA)이 40ms 미만이다. 실시간 팩터(RTF) 0.32를 달성해 약 3.1배 속도로 오디오를 생성한다. 이저 인퍼런스 시 GPU 메모리 사용량은 약 7.7 GiB로, 12GB GPU가 최소 권장 사양이다.
소스 코드는 Apache 2.0 라이선스지만, 모델 웨이트와 파생 모델, 셀프호스팅 출력물은 연구 및 비상업적 사용에 한정된다. 상업적 이용은 RESONIA, INC.의 서면 허가가 필요하다. 실시간 스트리밍 API를 통해 24kHz PCM 데이터를 수신할 수 있다.
BreezeBlue/Breeze-TTS-2
원문에 등록된 설명이 없습니다.
text-to-speech
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.