audio.cpp 0.5, 음성 AI 확장
[audio.cpp] Release 0.5: DramaBox expressive TTS, Confucius4 cross-lingual voice transfer, plus 7 more models and ROCm/HIP
·2026.08.01 09:43
audio.cpp 0.5가 표현형 TTS와 다국어 음성 전이, AMD GPU 지원을 추가했다.
audio.cpp 0.5가 새로운 음성 AI 모델과 플랫폼 기능을 대폭 추가했다.
- DramaBox: LTX-2.3 오디오 아키텍처 기반의 프롬프트 지향 음성 연기 모델로, 감정·말투·웃음·한숨·멈춤·전환·화자 행동 등을 제어한다.
- Confucius4-TTS: 참조 음성을 바탕으로 다른 지원 언어의 음성을 합성하는 다국어 음성 전이 기능을 제공한다.
- RVC 음성 변환
- BS-RoFormer 보컬 분리
- GLM-TTS, Kroko ASR, Parakeet-TDT, Inflect Micro v2, Fun-ASR-Nano 추가
Fun-ASR-Nano는 공식 FunASR 팀이 개발했으며, audio.cpp가 FunASR 공식 배포 플랫폼에도 등록됐다.
인프라 측면에서는 AMD GPU용 HIP/ROCm 지원이 초기 단계로 도입됐고, Apple Silicon의 Metal 성능도 개선됐다. 서버·스트리밍 경로에는 실시간 PCM 입력과 정리된 스트리밍 자막 델타가 추가돼 실제 서비스 통합이 쉬워졌다.
일부 모델 통합과 비-CUDA 백엔드는 아직 최적화 여지가 있으며, 프로젝트는 성능 개선·백엔드 테스트·문서화·Web UI·프로덕션 배포 피드백을 커뮤니티 기여 과제로 제시했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.