AI Briefing

WanSong의 이중 스템 음악 생성

Wan Team's WanSong Generates 5-Minute Songs With Dual Stems

·2026.07.17 19:08

Wan Team이 확산 기반 음악 생성 모델 WanSong을 공개했다.

Wan Team이 음악 생성 모델 WanSong에 대한 기술 보고서를 arXiv에 공개했다.

주요 특징:

  • 순수 확산(diffusion) 설계: 자동회귀 방식이나 다단계 파이프라인 없이 확산만으로 구현
  • 5분 길이 음악을 단일 생성 과정에서 직접 출력
  • 이중 스템: 보컬과 배경음악 트랙을 분리된 상태로 동시에 생성

기존 음악 생성 모델들이 언어 모델 백본과 확산 디코더의 조합을 사용하는 것과 달리, 확산만으로 이러한 성능을 달성한 점이 주목할 만하다.

편집 활용도: 미세조정(fine-tuning)과 커스터마이제이션 지원으로, 생성된 이중 스템은 음악 편집 도구에서 보컬과 악기를 독립적으로 처리할 수 있다. 이는 음악 편집 소프트웨어와 플러그인을 개발하는 개발자들에게 특히 유용하다. 혼합된 단일 트랙이 아닌 분리된 스템을 제공함으로써, 상위 계층 도구 개발의 기초가 될 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.