VDN-H3: 재생 시간보다 빠르게 영상을 생성하는 하이브리드 어텐션 모델 MiniMax H3 (단, H3 모델은 한국 사용 불가 주의)
·2026.09.09 18:30
핵심 내용
VDN-H3가 MiniMax H3에 하이브리드 어텐션을 적용해 영상 생성 속도를 최대 74배 높였으나 한국은 라이선스 제한으로 사용 불가하다.
1 / 3
자세히 보기
VDN-H3 연구진이 MiniMax H3 백본에 하이브리드 어텐션 아키텍처를 적용해 영상 생성 속도를 대폭 개선했다. 기존 Softmax Attention이 실행 시간의 85% 이상을 차지하던 병목을 해결하기 위해, 근접 프레임은 Softmax Attention으로 처리하고 먼 문맥은 양방향 Linear Attention으로 요약하는 방식을 채택했다.
성능 개선 및 벤치마크 768p 해상도, 14.4초 영상 생성 기준(디노이징 구간)으로 측정했을 때, Dense H3(1 GPU) 대비 74.5배 빠른 성능을 기록했다.
- 1 GPU: NFE당 16.74초 → 6.41초 (FP8 적용)
- 8 GPU 분산: NFE당 1.40초 (재생 시간보다 빠르게 생성)
- 블록 단위 가속: B200 기준 332.5ms → 125.3ms (2.65배 가속)
핵심 기술 및 제약 사항 Video Delta Attention(VDA)을 핵심 기여로 제시하며, 프레임 단위 정규 방정식을 통해 상태 갱신의 안정성을 확보했다. 학습은 3단계 정렬과 DMD2 기반 증류를 거쳤다. 다만, 가중치는 MiniMax H3 Community License를 따르며 대한민국, 미국, EU, 영국 지역에서는 사용, 복제, 배포가 금지된다. 한국 사용자는 코드만 참고 가능하며, 실제 모델 가중치 사용은 별도 협의가 필요하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.