카카오브레인, 오픈소스 ViT·ALIGN 공개
New ViT and ALIGN Models From Kakao Brain
·2023.03.06 09:00
핵심 내용
카카오브레인이 7억 개의 이미지-텍스트 쌍을 포함한 COYO 데이터셋과 이를 학습한 ViT, ALIGN 모델을 오픈소스로 공개했다.
1 / 2
자세히 보기
카카오브레인이 7억 개의 이미지-텍스트 쌍으로 구성된 오픈소스 데이터셋 COYO와, 이를 기반으로 학습된 ViT 및 ALIGN 시각-언어 모델을 공개했다. 이는 ALIGN 모델이 무료 및 오픈소스로 공개된 최초의 사례다.
이번 모델들은 Google의 기존 ViT 및 ALIGN 모델과 동일한 아키텍처를 사용하지만, 공개된 COYO 데이터셋을 통해 학습되어 연구자들이 데이터셋에 접근하여 모델을 재현할 수 있도록 돕는다.
주요 특징 및 성능:
- 성능:
ALIGN-B7-Base모델은 Google 모델보다 적은 데이터(7억 개 vs 18억 개)로도 Image KNN 분류 작업에서 대등한 성능을 보였으며, MS-COCO 검색 작업에서는 더 우수한 성능을 기록했다. - COYO 데이터셋: 7억 개의 이미지-텍스트 쌍을 포함하며, 미적 점수(Aesthetic Score), 워터마크 점수, 얼굴 수(Face count) 등 풍부한 메타데이터를 제공하여 LAION 2B 대비 세밀한 제어가 가능하다.
- 접근성: Hugging Face를 통해 ViT 및 ALIGN 데모를 직접 체험할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.