AI Briefing

Quanto 기반 Diffusion 메모리 최적화

Memory-efficient Diffusion Transformers with Quanto and Diffusers

·2024.07.30 09:00

Quanto 양자화 도구를 활용해 Diffusion Transformer 모델의 메모리 사용량을 효율적으로 줄이는 방법을 제시한다.

최근 고해상도 텍텍스트-이미지(T2I) 생성에 Transformer 기반 디퓨전 백본(Stable Diffusion 3, PixArt-Sigma 등)이 도입되면서 모델 규모가 커짐에 따라 메모리 요구량이 급증하고 있습니다. 예를 들어 Stable Diffusion 3는 FP16 정밀도 추론 시 약 18.765 GB의 GPU 메모리가 필요하여 소비자용 GPU에서 구동하기 어렵습니다.

Hugging Face는 Quanto 양자화 툴킷을 Diffusers 라이브러리에 통합하여, 품질 저하를 최소화하면서 메모리 효율을 높이는 기술적 방안을 제시합니다.

주요 기술적 특징:

  • 양자화 적용: PyTorch 기반의 Quanto를 사용하여 Diffusion 파이프라인의 메모리 점유율을 낮출 수 있습니다.
  • 대상 모델: PixArt-Sigma, Stable Diffusion 3, Aura Flow 등 주요 Transformer 기반 모델을 지원합니다.
  • 최적화 전략: bfloat16을 주요 연산 타입으로 사용하고, 수치적 안정성을 위해 VAE는 양자화에서 제외하는 것이 권장됩니다.
  • 데이터 타입: qint8INT4 양자화를 통해 메모리 절감 효과를 극대화할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.