AI Briefing

추천Minimax_h3_latent_Upscaler: Minimax H3 VAE 우회, 4배 해상도 영상 생성

LBH-123-AI/Minimax_h3_latent_Upscaler

·2026.08.23 08:03

Minimax H3 기반 영상 생성 시 고해상도 렌더링에 걸리는 시간을 크게 줄여준다. 약 50억 파라미터 규모의 VAE를 거치는 디코딩-픽셀 업스케일-인코딩 과정을 생략하고, 24채널 VAE latent에서 직접 공간 해상도를 높이는 방식이다. 시간 차원은 그대로 유지하면서 H×W 해상도만 확장한다.

기존의 bilinear이나 bicubic 같은 단순 보간법으로 latent를 확대할 때 발생하는 고스트링이나 이중 이미지 아티팩트를 방지한다. 3D 컨볼루션 백본과 시간 컨볼루션, trilinear interpolation을 결합한 구조로 학습된 모델이다. LTX 2.3 Spatial Upscaler와 Ttl의 neural-latent-upscaling 접근법을 참고해 설계했다.

약 80,000개의 저해상도-고해상도 페어 샘플로 학습했으며, 영상 70,000개와 2K 이미지 8,000개를 포함한다. 2배 확대가 40%를 차지하는 등 다양한 스케일 분포를 반영해 일반화 성능을 높였다. 1.0배부터 4.0배까지 0.1 단위 간격으로 연속적인 확대 배율을 지원한다.

ComfyUI 커스텀 노드와 함께 사용하도록 설계되어 있다. bfloat16, float16, float32 세 가지 정밀도의 체크포인트를 제공해 GPU 사양에 맞게 선택할 수 있다. Apache-2.0 라이선스로 배포되며, 고해상도 영상 생성 파이프라인의 병목 구간을 해결하려는 개발자에게 적합하다.

HuggingFace
HuggingFace 모델

LBH-123-AI/Minimax_h3_latent_Upscaler

원문에 등록된 설명이 없습니다.

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.