추천
MiniMax Music 3: 5분 길이의 음악 생성 모델 공개
MiniMax Music 3: 가사와 음악 설명만으로 5분 길이의 완성곡을 만드는 음악 생성 모델
·2026.08.16 20:30
핵심 내용
가사와 음악 설명을 기반으로 최대 5분 길이의 일관된 음악을 생성하는 MiniMax Music 3 모델이 공개되었다.
자세히 보기
MiniMax Music 3는 음악 생성의 난제인 장기적 구조 유지와 세밀한 음향 품질을 동시에 해결하기 위해 계층적 구조를 채택한 음악 생성 모델입니다.
핵심 아키텍처: Hybrid LM
- Global LLM (8B): 곡의 장기적인 구조와 의미적 흐름을 모델링하며, 첫 번째 RVQ 코드북을 예측합니다.
- Local LLM (0.6B): 각 프레임 내의 세밀한 음향 정보를 복원하기 위해 나머지 코드북을 예측합니다.
- 합성 단계: 이산적인 토큰 대신 전역 및 지역 모델의 **연속 은닉 상태(Hidden State)**를 융합하여 Flow Matching과 Flow-VAE를 통해 고품질의 오디오를 생성합니다.
제어 및 입력 방식 사용자는 가사와 함께 **구조화된 캡션(Structured Caption)**을 통해 정밀한 제어가 가능합니다.
- Global Metadata: 장르, BPM, 조성, 감정 진행 등.
- Vocal Details: 보컬 성별, 음색, 스타일 등.
- Arrangement: 악기 구성, 구간별 변화, 텍스처 등.
또한
[Verse],[Chorus]와 같은 구간 태그를 사용하여 곡의 구조를 명시할 수 있습니다.
배포 및 라이선스 정보
- 하드웨어 요구사항: 추론을 위해 CUDA GPU 2장이 필요하며, 현재는 비스트리밍(non-streaming) 방식만 지원합니다.
- 서빙: SGLang-Omni를 통해 서빙할 수 있습니다.
- 라이선스: MiniMax-Music3 커뮤니티 라이선스를 따릅니다. 상업적 이용 시 모델 명칭을 표기해야 하며, 연간 매출이 2,000만 달러를 초과할 경우 별도의 허가가 필요합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.