1억 개 규모 이미지 데이터셋 MONET 공개
A new dataset with more that 100M hi-quality, curated images, with captions and meta data! [P]
·2026.05.28 21:59
1억 개 이상의 고품질 이미지와 캡션으로 구성된 오픈소스 데이터셋 MONET이 공개되었다.
Jasper AI가 Apache 2.0 라이선스를 적용한 대규모 이미지-텍스트 데이터셋 MONET을 공개했다.
이 데이터셋은 29억 개의 이미지 중 정제 과정을 거쳐 선별된 1억 490만 개의 고품질 샘플을 포함한다. 모든 샘플에는 이미지와 함께 정교한 캡션 및 메타데이터가 포함되어 있다.
데이터셋과 함께 다음과 같은 기술 리소스도 함께 제공된다:
- arXiv 논문: 데이터셋 구축 방법론 상세 기술
- UMAP 시각화: 데이터 분포 확인용 도구
- 검색 도구: 텍스트 및 이미지 기반 검색 지원
- 학습 코드베이스: MONET 기반 Text-to-Image(T2I) 모델 학습용 코드
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.