AI Briefing

비확산 이미지 생성 모델 aMUSEd 공개

Welcome aMUSEd: Efficient Text-to-Image Generation

·2024.01.04 09:00

구글 MUSE를 재현한 비확산(non-diffusion) 방식의 효율적인 텍스트-이미지 생성 모델 aMUSEd가 공개되었습니다.

aMUSEd는 구글의 MUSE를 오픈 소스로 재현한 모델로, 기존의 잠재 확산(Latent Diffusion) 방식 대신 마스크 이미지 모델링(Masked Image Modeling, MIM) 방식을 채택했습니다.

MIM 방식은 추론 단계(inference steps)를 줄여 효율성을 높일 뿐만 아니라 모델의 해석 가능성을 향상시킵니다. 또한 단일 이미지를 활용한 뛰어난 스타일 전이(style transfer) 능력을 갖추고 있습니다.

주요 기술적 특징:

  • VQGAN을 통한 이미지 토큰화 및 U-ViT를 이용한 마스크 패치 예측
  • CLIP-L/14 텍스트 인코더를 통한 조건화
  • 이미지 크기 및 크롭 정보를 반영하는 마이크로 컨디셔닝(micro-conditioning) 적용

현재 Hugging Face의 diffusers 라이브러리에 통합되어 있어 즉시 사용 및 파인튜닝이 가능합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.