AI Briefing

Stable Audio 3

·2026.05.21 00:10

핵심 내용

Stable Audio 3가 가변 길이 오디오 생성·편집용 모델군으로 공개됐다.

자세히 보기

Stable Audio 3는 음악과 사운드 생성을 위한 fast latent diffusion model 계열로, small / medium / large 세 가지 크기로 제시됐다.

핵심은 가변 길이 생성과 오디오 편집이다. 몇 초짜리 소리부터 몇 분짜리 오디오까지 다룰 수 있도록 설계했고, 짧은 입력을 이어서 생성하는 continuation과 특정 구간만 바꾸는 inpainting도 지원한다.

모델은 새로운 semantic-acoustic autoencoder 위에서 동작한다. 오디오를 더 작은 latent 공간으로 압축해 diffusion 생성의 효율을 높이면서도, 음질 손실을 줄이고 latent 안에 의미 구조가 남도록 했다.

또한 adversarial post-training을 적용해 추론 속도와 품질을 함께 끌어올렸다. 논문은 적은 inference step으로도 더 나은 fidelity와 prompt adherence를 얻는다고 설명한다.

성능과 배포 측면에서는 다음이 강조된다.

  • H200 GPU에서 음악·사운드를 2초 미만에 생성
  • MacBook Pro M4에서도 몇 초 내 생성 가능
  • small과 medium 가중치를 공개해 소비자급 하드웨어에서 실행 가능
  • 학습 및 추론 파이프라인도 함께 공개

학습 데이터는 licensed 및 Creative Commons 데이터로 구성됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.