AI Briefing

Chinese CLIP: 중국어 기반의 Contrastive Vision-Language Pretraining

·2022.12.24 15:54

핵심 내용

중국어 문화와 도메인에 최적화된 멀티모달 모델 Chinese CLIP이 공개되었다.

1 / 2

자세히 보기

기존 CLIP을 번역하여 중국어에 적용할 경우, 번역 품질 문제와 중국 문화권의 이미지 도메인 적응 실패라는 한계가 존재한다. 이를 해결하기 위해 중국어 멀티모달 표현 학습을 위한 Chinese CLIP 프로젝트가 시작되었다.

학습 방식은 처음부터 학습하는 대신 효율적인 2단계 사전 학습(two-stage pretraining) 방식을 채택했다.

  • 1단계: ViT-B 또는 ResNet 기반 비전 인코더와 Chinese RoBERTa 언어 인코더를 초기화한다. 비전 인코더를 고정한 상태에서 언어 인코더를 CLIP 비전 인코더의 출력 공간에 맞게 조정한다.
  • 2단계: 비전 인코더의 잠금을 해제하고 두 타워를 함께 미세 조정하여 중국어 데이터의 이미지 분포를 학습한다.

LAION-5B의 중국어 데이터와 Wukong 데이터셋 등을 포함해 총 2억 개의 이미지-텍스트 쌍을 사용했다. 모델은 ResNet-50, ViT-B/16, ViT-L/14, ViT-H/14 등 총 5가지 버전을 제공한다.

실험 결과, MUGE, Flickr30K-CN, COCO-CN 등 주요 데이터셋에서 기존 모델을 압도했다. 특히 중국어 네이티브 데이터셋인 MUGE에서 가장 큰 성능 격차를 보이며, 언어 특화 모델의 강력한 효용성을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.