추천
로컬 음성 클론·더빙·전사 지원 오픈소스 'VoiceStudio' 공개
·2026.09.08 11:45
핵심 내용
로컬에서 음성 클론, 영상 더빙, 전사를 수행하는 오픈소스 도구 VoiceStudio가 공개되었다.
1 / 5
자세히 보기
로컬 하드웨어에서 음성 클론, 영상 더빙, 구술, 롱폼 오디오 제작을 지원하는 오픈소스 스튜디오 VoiceStudio가 공개되었습니다. 계정, API 키, 구독 없이 프라이빗하게 음성 AI 워크플로우를 실행할 수 있으며, macOS, Windows, Linux 및 Docker를 지원합니다.
주요 기능 및 엔진
- 다양한 엔진 지원: TTS 엔진 16개, ASR 엔진 11개, 646개 언어 카탈로그를 지원합니다.
- 핵심 워크플로우: Zero-shot 음성 클론, 음성 디자인, 영상 더빙(전사/번역/합성), 스토리/오디오북 제작, 시스템 전역 구술 위젯 등을 제공합니다.
- AI 워터마크: AudioSeal을 기본 통합하여 합성 음성의 출처를 식별할 수 있습니다.
- MCP 서버: Claude Desktop, Cursor 등 AI 에이전트와 연동되는 MCP 서버를 내장했습니다.
기술 아키텍처 및 API
- OpenAI 호환 API: 로컬 백엔드(
http://localhost:3900/v1)를 OpenAI API 엔드포인트로 대체하여 기존 클라이언트와 호환됩니다. - 아키텍처: Tauri v2(Rust) 데스크톱 셸, React + Vite UI, FastAPI 백엔드 구조를 따릅니다.
- 하드웨어 최적화: Apple Silicon(MPS/MLX), NVIDIA CUDA, Linux ROCm, CPU를 자동 감지하여 라우팅합니다.
라이선스 및 사용 조건
- 라이선스: 애플리케이션은 AGPL-3.0을 따르며, 다운로드된 모델은 각각의 업스트림 라이선스(예: OmniVoice 가중치는 CC-BY-NC)를 유지합니다.
- 프라이버시: 데이터는 기본적으로 로컬 디스크에만 저장되며, 원격 기능은 명시적 옵트인 방식입니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.