MiniMax-H3: 33B 단일 스트림으로 2K 영상과 스테레오 오디오 동시 생성
MiniMaxAI/MiniMax-H3
프로젝트 소개
MiniMax H3는 텍스트, 이미지, 영상, 오디오 등 다양한 멀티모달 입력을 통합적으로 이해하는 범용 생성 시스템이다. 복잡한 멀티모달 지시를 따르며, 최대 15초 길이와 2K 해상도의 영상에 네이티브 스테레오 오디오를 함께 생성한다. 출력 프레임률은 24 FPS이며, 오디오 샘플링 레이트는 32 kHz를 지원한다.
입력 방식에 따라 H3-Base-FL2VA와 H3-Base-Ref2VA 두 가지 변형이 제공된다. FL2VA는 0~2장의 이미지를 받아 텍스트-투-비디오, 첫/마지막 프레임 기반 생성, 또는 첫-마지막 프레임 간 보간 생성을 수행한다. Ref2VA는 최대 9장의 이미지, 3개의 영상 클립, 3개의 오디오 클립 등 최대 12개의 파일을 참조 입력으로 받아 더 복잡한 컨텍스트를 처리한다.
시스템은 H3-Context-IR, H3-Base, H3-Regenerate-2K 세 가지 모듈로 구성된다. H3-Context-IR은 자유 형식의 멀티모달 입력을 해석하고 구조화된 중간 표현으로 변환하는 호스팅된 전처리 시스템이다. H3-Base는 이 표현을 기반으로 768p 해상도의 영상과 오디오를 생성하며, H3-Regenerate-2K는 저해상도 결과와 원본 컨텍스트를 재사용해 2K 해상도로 재생성한다.
H3-Base는 33B 파라미터의 단일 스트림 Transformer 아키텍처를 사용하며, Qwen3-VL-32B의 사전 학습된 가중치를 인코더로 활용한다. 영상과 오디오는 각각 H3-VisualVAE와 H3-AudioVAE로 인코딩되어 통합된 멀티모달 시퀀스로 처리된다. 현재 오픈소스 릴리스에는 H3-Base 가중치가 포함되어 있으며, H3-Context-IR과 H3-Regenerate-2K는 API를 통해 사용하거나 공식 워크플로우를 따르는 방식으로 접근할 수 있다.
MiniMaxAI/MiniMax-H3
원문에 등록된 설명이 없습니다.
image-text-to-video
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.


