AI Briefing

Chinese CLIP: 중국어 기반의 Contrastive Vision-Language Pretraining

·2022.12.24 15:54

중국어 문화와 도메인에 최적화된 멀티모달 모델 Chinese CLIP이 공개되었다.

기존 CLIP을 번역하여 중국어에 적용할 경우, 번역 품질 문제와 중국 문화권의 이미지 도메인 적응 실패라는 한계가 존재한다. 이를 해결하기 위해 중국어 멀티모달 표현 학습을 위한 Chinese CLIP 프로젝트가 시작되었다.

학습 방식은 처음부터 학습하는 대신 효율적인 2단계 사전 학습(two-stage pretraining) 방식을 채택했다.

  • 1단계: ViT-B 또는 ResNet 기반 비전 인코더와 Chinese RoBERTa 언어 인코더를 초기화한다. 비전 인코더를 고정한 상태에서 언어 인코더를 CLIP 비전 인코더의 출력 공간에 맞게 조정한다.
  • 2단계: 비전 인코더의 잠금을 해제하고 두 타워를 함께 미세 조정하여 중국어 데이터의 이미지 분포를 학습한다.

LAION-5B의 중국어 데이터와 Wukong 데이터셋 등을 포함해 총 2억 개의 이미지-텍스트 쌍을 사용했다. 모델은 ResNet-50, ViT-B/16, ViT-L/14, ViT-H/14 등 총 5가지 버전을 제공한다.

실험 결과, MUGE, Flickr30K-CN, COCO-CN 등 주요 데이터셋에서 기존 모델을 압도했다. 특히 중국어 네이티브 데이터셋인 MUGE에서 가장 큰 성능 격차를 보이며, 언어 특화 모델의 강력한 효용성을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.