AI Briefing

audio.cpp 0.6 신규 모델 추가

[audio.cpp] Release 0.6: dots.tts, MiniMax-H3 text2audio (up to 3x realtime), MiniMax-Music3 (preview), and more new audio models. 5+ demos included.

·2026.08.17 07:36

핵심 내용

audio.cpp 0.6 버전이 출시되어 MiniMax-H3를 포함한 5종의 신규 모델 패밀리와 WebUI를 지원한다.

자세히 보기

audio.cpp 0.6 버전이 출시되었으며, dots.tts, NeuTTS-2e, MuScriptor, MiniMax-H3, SenseVoice-Small 등 5개의 새로운 모델 패밀리가 추가되었습니다. 이로써 총 49개의 모델 패밀리와 70개 이상의 모델 변형을 지원하게 되었습니다.

주요 업데이트 사항은 다음과 같습니다:

  • Native WebUI 도입: 사용자 편의를 위한 웹 인터페이스가 추가되었습니다.
  • MiniMax-H3 구현: 텍스트-오디오(TTS), 음성 복제, 음악 생성 등 다목적 활용이 가능하며, DiT(Diffusion Transformer) 모델 구축을 위한 핵심 구성 요소를 강화했습니다.
  • MiniMax-Music3 (프리뷰): 음악 생성 모델이 프리뷰 버전으로 포함되었습니다.
  • 실험적 비디오 프레임 생성: MiniMax-H3의 DiT 구조가 오디오와 비디오 잠재 변수(latents)를 함께 생성하는 특성을 활용하여, 실험적으로 RGB 프레임 데이터를 생성할 수 있는 기능을 제공합니다.

현재 CUDA, Vulkan, HIP 환경에서 테스트되었으며, 모델의 VRAM 사용량과 추론 속도(RTF)는 입력 오디오의 길이에 따라 달라질 수 있습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.