Stable Audio 3
·2026.05.21 00:10
Stable Audio 3가 가변 길이 오디오 생성·편집용 모델군으로 공개됐다.
Stable Audio 3는 음악과 사운드 생성을 위한 fast latent diffusion model 계열로, small / medium / large 세 가지 크기로 제시됐다.
핵심은 가변 길이 생성과 오디오 편집이다. 몇 초짜리 소리부터 몇 분짜리 오디오까지 다룰 수 있도록 설계했고, 짧은 입력을 이어서 생성하는 continuation과 특정 구간만 바꾸는 inpainting도 지원한다.
모델은 새로운 semantic-acoustic autoencoder 위에서 동작한다. 오디오를 더 작은 latent 공간으로 압축해 diffusion 생성의 효율을 높이면서도, 음질 손실을 줄이고 latent 안에 의미 구조가 남도록 했다.
또한 adversarial post-training을 적용해 추론 속도와 품질을 함께 끌어올렸다. 논문은 적은 inference step으로도 더 나은 fidelity와 prompt adherence를 얻는다고 설명한다.
성능과 배포 측면에서는 다음이 강조된다.
- H200 GPU에서 음악·사운드를 2초 미만에 생성
- MacBook Pro M4에서도 몇 초 내 생성 가능
- small과 medium 가중치를 공개해 소비자급 하드웨어에서 실행 가능
- 학습 및 추론 파이프라인도 함께 공개
학습 데이터는 licensed 및 Creative Commons 데이터로 구성됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.