MiniMax-Music3: 가사 두 줄로 5분 완곡, 인트로부터 아웃트로까지
MiniMaxAI/MiniMax-Music3
프로젝트 소개
MiniMax Music 3은 가사와 상세한 음악 설명을 조건으로 받아 최대 5분 분량의 완곡을 생성한다. 인트로, 베이스, 프리코러스, 코러스, 브릿지, 아웃트로 등 곡의 구조적 흐름을 유지하며, 긴 시퀀스에서도 보컬의 정체성과 리듬, 편곡의 진화를 일관되게 표현한다.
모델은 8B 파라미터의 Global LLM과 0.6B 파라미터의 Local LLM을 결합한 하이브리드 아키텍처를 사용한다. Global LLM은 곡의 장기적 구조와 의미를 담당하고, Local LLM은 프레임 단위의 미세한 음향 정보를 처리한다. 이 두 LLM의 히든 상태를 융합하여 Flow Matching과 Flow-VAE를 통해 32kHz, 16비트 스테레오 WAV 오디오를 출력한다.
입력으로는 가사와 음악 설명 두 가지를 받는다. 가사에는 [Verse], [Chorus] 같은 섹션 태그를 포함할 수 있으며, 음악 설명에서는 장르, BPM, 키, 보컬 스타일, 악기 구성 등 세부 요소를 지정할 수 있다. 구조화된 캡션을 사용하면 곡 전체의 스타일뿐 아니라 시간 경과에 따른 음악적 발전까지 정밀하게 제어할 수 있다.
CUDA 환경에서 추론이 가능하며, 현재는 비스트리밍 생성만 지원한다. 텍스트 프롬프트는 5,000 토큰, 오디오 생성은 9,000 음향 프레임까지 제한된다. 섹션 태그와 음악 설명은 생성적 제어 수단이며, 요청한 모든 세부 사항이 정확히 반영되지는 않을 수 있다.
MiniMaxAI/MiniMax-Music3
원문에 등록된 설명이 없습니다.
text-to-audio
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

