VoxCPM2 - 실제 음성과 비슷한 음성 복제가 가능한 다국어 음성 합성 오픈소스
·2026.04.15 09:31
핵심 내용
30개 언어·48kHz 출력을 지원하는 2B 규모 TTS/음성 복제 모델.
자세히 보기
VoxCPM2는 한국어 포함 30개 언어를 지원하는 tokenizer-free TTS 모델이다. 언어 태그 없이 텍스트만 넣어도 합성할 수 있고, 48kHz 스튜디오급 출력을 목표로 설계됐다.
음성 생성 방식도 구체적이다.
- Voice Design:
(A young woman, gentle and sweet voice)처럼 자연어 설명만 앞에 붙여 성별, 나이, 톤, 감정, 속도까지 지정할 수 있다. - Controllable Voice Cloning: 짧은 참조 클립으로 음색을 복제하면서 감정·속도·표현을 따로 조절할 수 있다.
- Ultimate Cloning: 참조 오디오와 대본을 함께 넣어 음색, 리듬, 감정, 스타일을 더 정밀하게 재현한다.
모델은 MiniCPM-4 기반의 2B 파라미터 구조이며, 200만 시간 이상의 다국어 음성 데이터로 학습됐다. 구조는 LocEnc → TSLM → RALM → LocDiT 파이프라인으로 설명된다.
실행 부담도 비교적 낮다. HF 모델 카드 기준 약 8GB VRAM으로 동작 가능하고, RTX 4090에서 RTF 약 0.30, Nano-vLLM 가속 시 약 0.13 수준이 제시된다.
파인튜닝은 5~10분 분량 오디오만으로도 가능하며, LoRA와 full SFT를 모두 지원한다. CPU 추론, ONNX, Apple Neural Engine, Rust 재구현, ComfyUI 노드 등 파생 구현도 제공된다.
라이선스는 Apache-2.0이라 상용 이용도 허용된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.