비확산 이미지 생성 모델 aMUSEd 공개
Welcome aMUSEd: Efficient Text-to-Image Generation
·2024.01.04 09:00
핵심 내용
구글 MUSE를 재현한 비확산(non-diffusion) 방식의 효율적인 텍스트-이미지 생성 모델 aMUSEd가 공개되었습니다.
1 / 2
자세히 보기
aMUSEd는 구글의 MUSE를 오픈 소스로 재현한 모델로, 기존의 잠재 확산(Latent Diffusion) 방식 대신 마스크 이미지 모델링(Masked Image Modeling, MIM) 방식을 채택했습니다.
MIM 방식은 추론 단계(inference steps)를 줄여 효율성을 높일 뿐만 아니라 모델의 해석 가능성을 향상시킵니다. 또한 단일 이미지를 활용한 뛰어난 스타일 전이(style transfer) 능력을 갖추고 있습니다.
주요 기술적 특징:
- VQGAN을 통한 이미지 토큰화 및 U-ViT를 이용한 마스크 패치 예측
- CLIP-L/14 텍스트 인코더를 통한 조건화
- 이미지 크기 및 크롭 정보를 반영하는 마이크로 컨디셔닝(micro-conditioning) 적용
현재 Hugging Face의 diffusers 라이브러리에 통합되어 있어 즉시 사용 및 파인튜닝이 가능합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.