AI Briefing

Audio8-TTS-Preview-0.1b: 170M 파라미터로 8개 언어 제로샷 보이스 클로닝

Audio8/Audio8-TTS-Preview-0.1b

·2026.08.25 08:06

참조 오디오와 텍스트만 제공하면 해당 목소리를 그대로 복제해 새로운 문장을 합성한다. 학습 과정 없이 즉시 동작하는 제로샷 방식이다. 중국어와 영어를 주력으로 지원하며, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어까지 실험적으로 다룬다.

주 모델은 약 170M 파라미터 규모로, 별도 코덱 디코더(약 120M)를 포함해도 현대적인 다국어 TTS 시스템보다 훨씬 가볍다. Fish S2 Pro(4.6B)나 MOSS-TTS(8.5B) 같은 대형 모델과 비교했을 때, 언어 및 오디오 모델의 풋프린트를 크게 줄여 실용적인 제로샷 TTS를 구현하는 데 초점을 맞췄다.

Audio8 Falcon H1 아키텍처를 기반으로 느린 분기는 의미론적 토큰을, 빠른 분기는 코덱 코드북을 예측하는 이중 자기회귀 구조를 채택했다. 44.1kHz 샘플레이트의 오디오 코덱이 저장소에 포함되어 있어 추가 체크포인트 없이 바로 구동할 수 있다.

제한된 GPU 환경에서 다국어 음성 합성을 테스트하거나, 소형 모델 기반 보이스 클로닝 파이프라인을 구축하려는 개발자에게 적합하다. Transformers 라이브러리를 통해 로드하며, 커스텀 코드를 사용하므로 trust_remote_code 옵션이 필요하다.

HuggingFace
HuggingFace 모델

Audio8/Audio8-TTS-Preview-0.1b

원문에 등록된 설명이 없습니다.

text-to-speech

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.