LoudKit: 음성 클로닝, 10개 언어 지원 및 Python, Swift, Go, Rust, TypeScript용 SDK를 갖춘 로컬 TTS
·2026.09.11 00:19
핵심 내용
음성 복제와 10개 언어를 지원하는 오픈소스 로컬 TTS 'LoudKit'이 공개되었다.
자세히 보기
음성 복제 기능과 10개 언어 지원을 갖춘 오픈소스 로컬 TTS 프로젝트 LoudKit이 공개되었다. Chatterbox를 기반으로 최적화되었으며, 품질은 유사하지만 더 작고 빠른 것이 특징이다.
주요 기능 및 성능
- 다중 언어 SDK: Python, Swift, Go, Rust, TypeScript 등 5개 언어용 SDK를 제공한다. 각 어댑터에서 동일한 음성 토큰을 생성하도록 설계되어 언어별 품질 편차를 줄였다.
- 두 가지 변형: 기본 모델 loudr-1과, 파이프라인의 병목 지점에 추가 헤드(head)를 부착해 두 개의 오디오 토큰을 동시에 예측하도록 훈련한 loudr-1-turbo가 포함된다. Turbo 버전은 속도가 빠르지만 일부 아티팩트가 발생할 수 있다.
- 음성 복제: 약 10초 분량의 깨끗한 녹음 파일을 입력하면 효과적으로 작동하며, 배경 소음이나 긴 공백이 있으면 품질이 저하될 수 있다.
라이선스 및 데이터
- 코드와 모델 가중치는 Apache 2.0 라이선스로 배포된다.
- 포함된 모든 음성 데이터는 동의 하에 기부되었거나 CC0/CC-BY 라이선스를 따르며 출처가 문서화되었다.
- 감정 표현 태그(emotion axis) 기능은 현재 개발 중으로 이번 릴리스에는 포함되지 않았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.