AI Briefing

LG AI Research: UniCLIP 기술 소개

·2026.07.16 09:00

핵심 내용

데이터 효율성을 높이기 위해 도메인 간 경계를 허문 통합 대조 학습 프레임워크 UniCLIP을 소개한다.

1 / 2

자세히 보기

기존의 CLIP은 이미지와 텍스트 쌍을 활용해 뛰어난 성능을 보였으나, 이미지-이미지(intra-domain)와 이미지-텍스트(inter-domain) 간의 대조 학습이 서로 다른 공간에서 독립적으로 정의되는 한계가 있었다.

UniCLIP은 이를 극복하기 위해 모든 도메인 쌍을 단일 통합 임베딩 공간 내에서 정의하는 통합 프레임워크를 제안한다. 이를 통해 데이터 효율성을 극대화하고 기존 대조 학습의 범위를 확장했다.

특히 이미지 증강(Augmentation) 과정에서 발생하는 이미지-텍스트 불일치(Misalignment) 문제를 해결하는 데 집중했다. Flip, Grayscale, Crop 등의 증강이 적용되면 이미지와 텍스트의 관계가 변할 수 있는데, UniCLIP은 이를 보정할 수 있는 구조를 갖췄다.

핵심 기술인 Augmentation-aware Projection Head는 다음과 같은 역할을 수행한다:

  • Augmentation Encoder를 통해 적용된 증강 정보를 인코딩한다.
  • 인코딩된 증강 정보와 이미지 특징을 함께 Projection Head로 전달한다.
  • 이를 통해 증강으로 인한 불일치를 임베딩 단계에서 직접 보정한다.

실험 결과, UniCLIP은 CC3M, CC12M, YFCC15M과 같은 오픈 데이터셋에서 기존 CLIP 방식보다 높은 성능을 입증했으며, ImageNet Zero-shot 성능에서도 증강 임베딩을 사용했을 때 더 우수한 결과를 보였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.