AI Briefing

Stable Audio 3

·2026.05.21 00:10

Stable Audio 3가 가변 길이 오디오 생성·편집용 모델군으로 공개됐다.

Stable Audio 3는 음악과 사운드 생성을 위한 fast latent diffusion model 계열로, small / medium / large 세 가지 크기로 제시됐다.

핵심은 가변 길이 생성오디오 편집이다. 몇 초짜리 소리부터 몇 분짜리 오디오까지 다룰 수 있도록 설계했고, 짧은 입력을 이어서 생성하는 continuation과 특정 구간만 바꾸는 inpainting도 지원한다.

모델은 새로운 semantic-acoustic autoencoder 위에서 동작한다. 오디오를 더 작은 latent 공간으로 압축해 diffusion 생성의 효율을 높이면서도, 음질 손실을 줄이고 latent 안에 의미 구조가 남도록 했다.

또한 adversarial post-training을 적용해 추론 속도와 품질을 함께 끌어올렸다. 논문은 적은 inference step으로도 더 나은 fidelityprompt adherence를 얻는다고 설명한다.

성능과 배포 측면에서는 다음이 강조된다.

  • H200 GPU에서 음악·사운드를 2초 미만에 생성
  • MacBook Pro M4에서도 몇 초 내 생성 가능
  • smallmedium 가중치를 공개해 소비자급 하드웨어에서 실행 가능
  • 학습 및 추론 파이프라인도 함께 공개

학습 데이터는 licensedCreative Commons 데이터로 구성됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.