AI Briefing

캐릭터 단위 TTS 모델 공개

We released TontaubeV1, a character-level TTS model for long-form generation [P]

·2026.09.01 21:23

핵심 내용

캐릭터 단위 토큰화와 DualCodec 기반의 2.9B 파라미터 오픈 웨이트 TTS 모델 TontaubeV1이 공개됐다.

자세히 보기

TontaubeV1은 2.9B 파라미터의 오픈 웨이트 텍스트 음성 변환(TTS) 모델로, 장문 생성과 저지연 로컬 추론에 최적화되어 공개됐다. 이 모델은 영어와 독일어를 주로 지원하며, 최대 1분 분량의 참고 오디오를 통한 제로샷 음성 클로닝 기능을 제공한다.

캐릭터 단위 토큰화 적용

대부분의 최신 LLM 기반 TTS 모델은 백본 모델의 BPE 토크나이저를 사용하지만, TontaubeV1은 Qwen3-1.7B 체크포인트를 기반으로 하되 음성 텍스트를 개별 문자(character) 시퀀스로 강제 토큰화하는 방식을 채택했다. 개발진은 이를 통해 언어 이해 능력은 유지하면서 문자-소리 매핑을 단순화하고, 희귀한 토큰 시퀀스로 인한 분포 외(out-of-distribution) 오류를 줄일 수 있었다고 밝혔다.

학습 데이터 및 아키텍처

이 모델은 DualCodec 멀티 코드북 이산 오디오 코덱을 기반으로 구축되었으며, 7개 언어로 약 20만 시간의 오디오 데이터를 학습했다. 현재는 영어와 독일어 환경에서 주로 테스트 및 검증이 이루어졌다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.