audio.cpp, GGML 기반 오디오 생성 모델 확장
[audio.cpp] The Sound of GGML — C++/GGML native ACE-Step, Stable Audio, HeartMuLa, RoFormer, HTDemucs released. 10-Minute Music in 60 Seconds!
·2026.07.03 12:12
C++/GGML 기반 프레임워크인 audio.cpp가 음악 및 SFX 생성, 음원 분리 기능을 추가하며 대규모 업데이트를 실시했다.
C++/GGML 네이티브 프레임워크인 audio.cpp가 음악 및 효과음(SFX) 생성, 음원 분리(Source Separation) 기능을 포함한 대규모 확장을 발표했다. 이번 업데이트를 통해 해당 프레임워크는 음성(TTS), ASR/VAD, 음성 변환을 넘어 오디오 생성 전반을 지원하는 통합 프레임워크로 진화했다.
주요 업데이트 모델:
- ACE-Step 1.5 (Turbo/Base): 고속 음악 생성 지원
- HeartMuLa: 최대 10분 길이의 오디오 생성 가능
- Stable Audio 3 (Small/Medium): 음악 및 SFX 생성
- Mel-Band RoFormer 및 HTDemucs: 음원 분리 기능
성능 및 특징:
- ACE-Step Turbo 기준, Python 대비 약 1.4배 빠른 실행 속도(RTF 0.100)를 기록하며 효율성을 입증했다.
- 서버 환경 및 장시간 실행을 위한 mem_saver 모드를 지원하여 실행 후 VRAM 점유율을 낮출 수 있다.
- 현재 프레임워크 완성도는 약 75% 수준이며, 향후 백엔드 성능 최적화가 진행될 예정이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.