예술적 실험을 위한 open-weight Stable Audio 3.0 모델 패밀리 공개
Stability AI가 fully licensed data로 학습한 Stable Audio 3.0 모델 패밀리를 공개했다.
Stable Audio 3.0는 fully licensed data로 학습한 음악 생성 모델 패밀리로, 3개 open-weight 모델을 Hugging Face에 공개했다. 목표는 이미지 생성에서 Stable Diffusion이 만든 것처럼, 오디오 영역에서도 커뮤니티 중심의 실험을 넓히는 것이다.
- Stable Audio 3.0 Small SFX: 모바일과 보급형 노트북에서 구동되는 sound effects 생성용 모델.
- Stable Audio 3.0 Small: 기기 내에서 full music composition을 지원하는 모델.
- Stable Audio 3.0 Medium: 더 높은 음악적 완성도와 최대 6분 20초 길이의 트랙을 생성하는 모델.
- Stable Audio 3.0 Large: 음악 플랫폼과 크리에이티브 앱을 위한 고성능 모델로, 저지연·대량 생성에 맞춰졌다.
라이선스는 Community License와 Enterprise License로 나뉜다. Community License에서는 사용자가 출력물의 소유권을 가지며 배포와 상업적 활용이 가능하고, 연매출 100만 달러를 넘는 조직은 Enterprise License로 상업적 커버리지와 법적 면책 보장을 받을 수 있다.
기술적으로는 새로운 semantic-acoustic autoencoder가 핵심이다. 이를 통해 초 단위로 길이를 지정하는 variable-length generation이 가능해졌고, 3.0 Small은 최대 2분, 3.0 Medium과 3.0 Large는 6분 이상을 생성한다. 회사는 3.0 Small이 기기 내에서 완전한 음악 작곡이 가능한 유일한 모델이라고 설명한다.
추가로 LoRa training 문서를 처음 공개해 자체 라이브러리 기반 fine-tuning을 지원하고, single-segment editing, multi-segment editing, causal continuation을 포함한 오디오 inpainting 기능도 제공한다. 3.0 Large는 Stability AI API와 기업용 자체 호스팅으로 제공되며, Universal Music Group과 Warner Music Group과의 협업을 바탕으로 뮤지션용 새 제품도 준비 중이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.