Quanto 기반 Diffusion 메모리 최적화
Memory-efficient Diffusion Transformers with Quanto and Diffusers
·2024.07.30 09:00
Quanto 양자화 도구를 활용해 Diffusion Transformer 모델의 메모리 사용량을 효율적으로 줄이는 방법을 제시한다.
최근 고해상도 텍텍스트-이미지(T2I) 생성에 Transformer 기반 디퓨전 백본(Stable Diffusion 3, PixArt-Sigma 등)이 도입되면서 모델 규모가 커짐에 따라 메모리 요구량이 급증하고 있습니다. 예를 들어 Stable Diffusion 3는 FP16 정밀도 추론 시 약 18.765 GB의 GPU 메모리가 필요하여 소비자용 GPU에서 구동하기 어렵습니다.
Hugging Face는 Quanto 양자화 툴킷을 Diffusers 라이브러리에 통합하여, 품질 저하를 최소화하면서 메모리 효율을 높이는 기술적 방안을 제시합니다.
주요 기술적 특징:
- 양자화 적용: PyTorch 기반의 Quanto를 사용하여 Diffusion 파이프라인의 메모리 점유율을 낮출 수 있습니다.
- 대상 모델: PixArt-Sigma, Stable Diffusion 3, Aura Flow 등 주요 Transformer 기반 모델을 지원합니다.
- 최적화 전략:
bfloat16을 주요 연산 타입으로 사용하고, 수치적 안정성을 위해 VAE는 양자화에서 제외하는 것이 권장됩니다. - 데이터 타입:
qint8및INT4양자화를 통해 메모리 절감 효과를 극대화할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.