AI Briefing

voicebox: 클라우드 없이 로컬에서 음성 복제부터 에이전트 대화까지

jamiepine/voicebox

·2026.09.15 14:42

ElevenLabs와 WisprFlow가 각각 담당하던 음성 출력과 입력 기능을 하나로 통합했다. 몇 초 분량의 오디오 샘플로 목소리를 복제하거나 50개 이상의 프리셋 중 하나를 선택해 23개 언어의 자연스러운 음성을 생성한다. 모든 연산이 로컬에서 처리되어 음성 데이터가 외부 서버로 전송되지 않는다.

Qwen3-TTS, Kokoro, Chatterbox 등 7가지 TTS 엔진을 상황에 따라 전환할 수 있다. Chatterbox Turbo를 선택하면 [laugh], [sigh] 같은 감정 태그를 인식해 표현력 있는 대사를 만들어낸다. Spotify의 pedalboard 라이브러리를 기반으로 한 8가지 오디오 효과와 자동 청킹 기능을 통해 긴 스크립트도 끊김 없이 합성한다.

전역 단축키를 누르면 어떤 앱에서든 음성으로 텍스트를 입력할 수 있으며, Whisper 기반 STT가 이를 즉시 변환한다. MCP 서버를 내장해 Claude Code나 Cursor 같은 AI 에이전트가 지정된 목소리로 답변하도록 연결할 수 있다. Tauri와 Rust로 구축되어 Electron 대비 가벼운 네이티브 성능을 제공한다.

GitHub
GitHub 저장소

jamiepine/voicebox

The open-source AI voice studio. Clone, dictate, create.

TypeScript

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.