AI Briefing

C++ 기반 통합 오디오 추론 프레임워크 audio.cpp 공개

audio.cpp: 12 audio models (Qwen3-TTS, PocketTTS, VeVo2 etc) in 1 C++/ggml runtime — TTS up to 5x faster than Python on CUDA

·2026.06.26 08:10

ggml 기반의 C++ 오디오 추론 프레임워크 audio.cpp가 출시되어 Python 대비 최대 5배 빠른 속도를 제공한다.

ggml을 기반으로 구축된 네이티브 C++ 추론 프레임워크인 audio.cpp가 공개되었습니다. 이 프레임워크는 개별적인 Python 환경과 의존성 트리를 가진 오디오 모델들을 하나의 런타임, 세션 처리, CLI 및 서버 환경으로 통합하는 것을 목표로 합니다.

현재 12개의 모델 패밀리가 정식 릴리스되어 즉시 사용 가능하며, 주요 포함 모델은 다음과 같습니다:

  • TTS / Voice Cloning: Qwen3-TTS, PocketTTS, MioTTS, OmniVoice, Chatterbox 등
  • ASR / VAD: Qwen3-ASR, Qwen3 Forced Aligner, Silero VAD
  • Voice Conversion / Codec: Vevo2, Seed-VC, MioCodec

특히 Vevo2의 경우 TTS, 노래 생성, 노래 변환 및 편집 기능을 모두 지원합니다.

성능 측면에서 CUDA 환경(Ubuntu) 기준, Python 레퍼런스 구현체 대비 현저한 속도 향상을 보여줍니다:

  • PocketTTS: 1-shot 실행 시 3.68배 빠름
  • Qwen3-TTS: 1-shot 실행 시 1.83배, Long-form 실행 시 3.06배 빠름
  • Vevo2: 1-shot 실행 시 5.03배 빠름
  • MioTTS: 1-shot 실행 시 2.73배 빠름

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.