AI Briefing

고품질 이미지-텍스트 데이터셋 MONET 공개

A new dataset with more that 100M hi-quality, curated images, with captions and meta data! [P]

·2026.05.28 21:59

29억 개의 이미지에서 정제한 1억 개 이상의 고품질 이미지-텍스트 데이터셋 MONET이 공개되었습니다.

MONET은 Apache 2.0 라이선스로 제공되는 오픈 소스 이미지-텍스트 데이터셋입니다. 총 29억 개의 이미지를 기반으로 정제 과정을 거쳐, 최종적으로 1억 490만 개의 고품질 샘플을 구축했습니다.

이 프로젝트와 함께 다음과 같은 도구들도 함께 제공됩니다:

  • 데이터 분포 시각화를 위한 UMAP 도구
  • 텍스트 및 이미지 검색을 위한 Retrieval tool
  • MONET 기반의 T2I(Text-to-Image) 모델 학습용 코드베이스

데이터셋은 Hugging Face를 통해 이용할 수 있으며, 데이터 구축 과정을 상세히 설명하는 논문도 함께 발표되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.