AI Briefing

audio.cpp, Higgs Audio TTS 효율성 강화 및 WebUI 히스토리 추가

[audio.cpp] Recent updates you might have missed: Higgs Audio TTS use 48% less VRAM (< 6GB), HTDemucs 2.2× faster, PocketTTS 2.2× faster on CPU, and WebUI generation history feature

·2026.10.08 21:58

핵심 내용

Higgs Audio TTS가 6GB 미만 VRAM으로 구동되며 HTDemucs는 CUDA에서 2.21배 빨라졌다.

자세히 보기

audio.cpp의 최근 업데이트로 로컬 오디오 모델 추론 성능이 대폭 개선되고 새로운 기능이 추가됐다. 가장 주목할 만한 변화는 GitHub 사용자 mirek190이 기여한 Higgs Audio TTS의 피크 VRAM 사용량 48% 감소로, 약 6 GB 메모리로 실행할 수 있게 됐다.

성능 개선

업데이트에는 여러 모델의 상당한 속도 향상과 메모리 최적화가 포함됐으며, 정확성과 일관성은 유지된다.

  • HTDemucs: CUDA에서 2.21배, Vulkan에서 1.95배 속도 향상
  • PocketTTS: CPU에서 2.23배 속도 향상 및 RAM 9% 감소
  • ACE-Step 시리즈: VRAM 6~7% 감소, CUDA에서 1.06~1.08배, Vulkan에서 1.16~1.20배 속도 향상
  • MOSS-TTS v1.5 클로닝: VRAM 21% 감소, CUDA에서 1.05배 속도 향상
  • Echo-TTS (Memory Saver): VRAM 20% 감소
  • Qwen3-TTS: VRAM 16~20% 감소
  • IndexTTS2 / 2.5: VRAM 12% 감소

새로운 기능 및 지원

WebUI에는 실험적인 생성 히스토리 기능이 추가돼 사용자가 이전 출력물을 다시 확인하고 설정을 복원할 수 있다. 이 라이브러리는 현재 110개 이상의 오디오 모델 시리즈와 190개 이상의 변형을 지원하며, CUDA, Vulkan, Metal, AMD/HIP, CPU 백엔드 전반에서 메모리 효율성과 추론 속도를 지속적으로 개선하고 있다. 프로젝트는 WebUI 프론트엔드 개발 및 UI/UX 디자인 기여자도 모집 중이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.