AI Briefing

카카오브레인, 오픈소스 ViT·ALIGN 공개

New ViT and ALIGN Models From Kakao Brain

·2023.03.06 09:00

카카오브레인이 7억 개의 이미지-텍스트 쌍을 포함한 COYO 데이터셋과 이를 학습한 ViT, ALIGN 모델을 오픈소스로 공개했다.

카카오브레인이 7억 개의 이미지-텍스트 쌍으로 구성된 오픈소스 데이터셋 COYO와, 이를 기반으로 학습된 ViTALIGN 시각-언어 모델을 공개했다. 이는 ALIGN 모델이 무료 및 오픈소스로 공개된 최초의 사례다.

이번 모델들은 Google의 기존 ViT 및 ALIGN 모델과 동일한 아키텍처를 사용하지만, 공개된 COYO 데이터셋을 통해 학습되어 연구자들이 데이터셋에 접근하여 모델을 재현할 수 있도록 돕는다.

주요 특징 및 성능:

  • 성능: ALIGN-B7-Base 모델은 Google 모델보다 적은 데이터(7억 개 vs 18억 개)로도 Image KNN 분류 작업에서 대등한 성능을 보였으며, MS-COCO 검색 작업에서는 더 우수한 성능을 기록했다.
  • COYO 데이터셋: 7억 개의 이미지-텍스트 쌍을 포함하며, 미적 점수(Aesthetic Score), 워터마크 점수, 얼굴 수(Face count) 등 풍부한 메타데이터를 제공하여 LAION 2B 대비 세밀한 제어가 가능하다.
  • 접근성: Hugging Face를 통해 ViT 및 ALIGN 데모를 직접 체험할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.