고압축 기반 Würstchen 공개
Introducing Würstchen: Fast Diffusion for Image Generation
·2023.09.13 09:00
핵심 내용
42배의 높은 공간 압축률을 통해 학습 및 추론 비용을 획기적으로 줄인 새로운 확산 모델 Würstchen이 공개되었다.
자세히 보기
Würstchen은 이미지의 텍스트 조건부 컴포넌트가 매우 압축된 잠재 공간(latent space)에서 작동하는 확산 모델이다.
기존 모델들이 4~8배의 공간 압축을 사용하는 것과 달리, Würstchen은 42배의 공간 압축을 달성하여 계산 비용을 대폭 절감했다. 모델 구조는 다음과 같이 세 단계로 구성된다.
- Stage A & B (Decoder): VQGAN과 Diffusion Autoencoder를 결합하여 압축된 이미지를 픽셀 공간으로 복원한다.
- Stage C (Prior): 고도로 압축된 잠재 공간에서 학습되는 모델이다.
주요 특징 및 장점
- 획기적인 비용 절감: Würstchen v1은 512x512 해상도 학습에 9,000 GPU 시간이 소요되어, Stable Diffusion 1.4(150,000 GPU 시간) 대비 약 16배 저렴하다.
- 빠른 추론 및 저메모리: SDXL보다 훨씬 빠른 속도와 적은 메모리로 이미지 생성이 가능하여 하드웨어 제약이 적다.
- 해상도 확장성: 1024x1024 및 1536x1536 해상도 학습을 지원하며, 새로운 해상도에 대한 미세 조정(fine-tuning) 비용이 매우 낮다.
현재 모델은 Hugging Face Hub에서 이용 가능하며, Diffusers 라이브러리에 통합되어 즉시 사용 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.