AI Briefing

VoiceStudio: 16개 TTS 엔진 통합한 로컬 음성 클로닝·더빙 스튜디오

debpalash/VoiceStudio

·2026.08.31 23:16

클라우드 구독이나 API 키 없이 로컬 환경에서 음성 복제, 영상 더빙, 긴 오디오 생성을 처리한다. 646개 언어를 지원하는 16개의 TTS 엔진과 11개의 ASR 엔진을 내장해 모델 전환이 자유롭다.

짧은 샘플 음성만으로 화자를 복제하거나, 나이와 억양 설정으로 새로운 목소리를 설계할 수 있다. 영상 더빙 시 화자 식별과 번역, 합성까지 자동화하며, EPUB 파일로 오디오북을 생성해 .m4b 형식으로 내보낸다.

데이터가 외부로 전송되지 않는 로컬 우선 구조로, 프라이버시 보호가 필요한 작업이나 대량 처리에 적합하다. CUDA, Apple Silicon, ROCm 등 다양한 하드웨어를 자동 감지하며, OpenAI 호환 API와 MCP 서버를 제공해 기존 워크플로우에 쉽게 통합된다.

GitHub
GitHub 저장소

debpalash/VoiceStudio

VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.

Python

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.