SGLang, MiniMax-H3 영상 생성서 Cache-DiT 및 SubBlock 적용해 최대 6.24배 가속화
·2026.08.28 09:00
핵심 내용
SGLang Diffusion 팀이 NVIDIA H200 8대에서 MiniMax-H3 영상 생성 모델을 Cache-DiT와 SubBlock 희소 어텐션으로 최대 6.24배 가속화했다.
자세히 보기
SGLang Diffusion 팀은 NVIDIA H200 GPU 8대를 사용해 MiniMax-H3 영상 생성 모델의 성능을 벤치마크했다. Diffusers 라이브러리를 기준점으로 삼았을 때, 손실 없는(lossless) SGLang 런타임은 1.85~1.95배의 가속 효과를 보였다.
가속화 전략 및 성능
추가적인 손실(lossy) 가속화를 위해 Cache-DiT(단계 재사용)와 SubBlock Sparse Attention(희소 어텐션)을 결합했다. 이 조합은 최대 6.24배의 가속을 달성했으며, SSIM(구조 유사성) 지수는 0.76~0.91 범위를 기록했다.
- Cache-DiT 단독: 품질 저하 없이 최대 2.99배 가속
- SubBlock 0.80 + Cache-DiT: T2VA(텍스트-영상-오디오)에서 5.06~5.72배, FL2VA(첫 프레임-영상-오디오)에서 5.86~6.24배 가속
- 품질 트레이드오프: FL2VA 작업은 SSIM 0.85~0.91로 높은 품질을 유지했으나, T2VA 작업은 SSIM 0.76~0.78로 다소 하락했다.
기술적 기여
가속화는 세 가지 주요 요소에서 비롯된다. 먼저 Fused Kernels가 개별 연산 사이트에서 2.00~12.16배의 효율을 제공하며, Cache-DiT는 중복 디노이징 단계를 건너뛰어 연산량을 줄인다. 마지막으로 SubBlock Sparse Attention은 실행되는 단계에서도 어텐션 계산 비용을 절감한다. 이번 벤치마크는 양자화나 점진적 해상도 조정 등 다른 가속 기법은 포함하지 않았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.