AI Briefing

Tontaube, 오픈 TTS 모델 공개

TontaubeV1 - Open TTS model release for local long-form generation

·2026.08.28 18:54

핵심 내용

Tontaube가 장문 생성과 저지연 추론에 특화된 2.9B 파라미터 오픈 소스 TTS 모델 TontaubeV1를 공개했다.

자세히 보기

Tontaube 공동 창업자가 장문 생성, 표현력 있는 음성, 저지연 로컬 추론에 초점을 맞춘 2.9B 파라미터 오픈 소스 TTS 모델 TontaubeV1을 공개했다. 이 모델은 영어와 독일어를 주로 지원하며, 최대 1분 분량의 참조 오디오를 통한 제로샷 음성 클로닝 기능을 제공한다.

기술적 특징 및 성능

TontaubeV1은 거친 의미 구조에서 음향 세부 사항까지 코덱 스트림을 생성하기 위해 네 개의 별개 자기회귀 모델을 사용하며, 높은 코드북으로 갈수록 모델 크기가 점진적으로 작아진다. 문자 단위 텍스트 토큰화와 정렬된 텍스트 및 오디오 간 공유된 논리적 위치를 활용한다. 롤링 컨텍스트 윈도우를 통해 스트리밍 및 사실상 무제한의 장문 생성이 가능하며, vLLM 기반 추론으로 요청 및 음향 단계 간 배칭을 지원한다.

RTX 5090 기준 측정 결과, 단일 텍스트에서 약 0.08 RTF(Real-Time Factor), 배칭 시 최대 0.02 RTF(약 50배 실시간 속도)를 달성했다. 첫 오디오 인코딩까지의 지연 시간은 약 200ms이다.

하드웨어 요구사항 및 벤치마크

현재 릴리스는 저용량 및 균형 프로필에서 최소 24GB VRAM, 고처리량 프로필에서 32GB VRAM을 요구한다. 이는 높은 동시성과 저지연 서빙을 위한 vLLM 구현 때문이다. 향후 더 작은 GPU 및 소형 디바이스용 양자화 버전을 출시할 계획이다.

400개 지문을 대상으로 한 LLM 평가 기준(audiobook benchmark)에서 TontaubeV1은 운율(prosody) 측면에서 ElevenLabs Flash v2.5 대비 **50.1%**의 점수를 기록했으며, Fish Audio S2 Pro, Gradium, Cartesia보다 선호되었다. 대규모 인간 청취 테스트는 아직 수행되지 않았으나, 향후 TTS Arena 등을 통해 검증할 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.