AI Briefing
추천

로컬 음성 클론·더빙·전사 지원 오픈소스 'VoiceStudio' 공개

·2026.09.08 11:45

핵심 내용

로컬에서 음성 클론, 영상 더빙, 전사를 수행하는 오픈소스 도구 VoiceStudio가 공개되었다.

1 / 5

자세히 보기

로컬 하드웨어에서 음성 클론, 영상 더빙, 구술, 롱폼 오디오 제작을 지원하는 오픈소스 스튜디오 VoiceStudio가 공개되었습니다. 계정, API 키, 구독 없이 프라이빗하게 음성 AI 워크플로우를 실행할 수 있으며, macOS, Windows, Linux 및 Docker를 지원합니다.

주요 기능 및 엔진

  • 다양한 엔진 지원: TTS 엔진 16개, ASR 엔진 11개, 646개 언어 카탈로그를 지원합니다.
  • 핵심 워크플로우: Zero-shot 음성 클론, 음성 디자인, 영상 더빙(전사/번역/합성), 스토리/오디오북 제작, 시스템 전역 구술 위젯 등을 제공합니다.
  • AI 워터마크: AudioSeal을 기본 통합하여 합성 음성의 출처를 식별할 수 있습니다.
  • MCP 서버: Claude Desktop, Cursor 등 AI 에이전트와 연동되는 MCP 서버를 내장했습니다.

기술 아키텍처 및 API

  • OpenAI 호환 API: 로컬 백엔드(http://localhost:3900/v1)를 OpenAI API 엔드포인트로 대체하여 기존 클라이언트와 호환됩니다.
  • 아키텍처: Tauri v2(Rust) 데스크톱 셸, React + Vite UI, FastAPI 백엔드 구조를 따릅니다.
  • 하드웨어 최적화: Apple Silicon(MPS/MLX), NVIDIA CUDA, Linux ROCm, CPU를 자동 감지하여 라우팅합니다.

라이선스 및 사용 조건

  • 라이선스: 애플리케이션은 AGPL-3.0을 따르며, 다운로드된 모델은 각각의 업스트림 라이선스(예: OmniVoice 가중치는 CC-BY-NC)를 유지합니다.
  • 프라이버시: 데이터는 기본적으로 로컬 디스크에만 저장되며, 원격 기능은 명시적 옵트인 방식입니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.