AI Briefing

LG AI Research: UniCLIP 기술 소개

·2026.07.16 09:00

데이터 효율성을 높이기 위해 도메인 간 경계를 허문 통합 대조 학습 프레임워크 UniCLIP을 소개한다.

기존의 CLIP은 이미지와 텍스트 쌍을 활용해 뛰어난 성능을 보였으나, 이미지-이미지(intra-domain)와 이미지-텍스트(inter-domain) 간의 대조 학습이 서로 다른 공간에서 독립적으로 정의되는 한계가 있었다.

UniCLIP은 이를 극복하기 위해 모든 도메인 쌍을 단일 통합 임베딩 공간 내에서 정의하는 통합 프레임워크를 제안한다. 이를 통해 데이터 효율성을 극대화하고 기존 대조 학습의 범위를 확장했다.

특히 이미지 증강(Augmentation) 과정에서 발생하는 이미지-텍스트 불일치(Misalignment) 문제를 해결하는 데 집중했다. Flip, Grayscale, Crop 등의 증강이 적용되면 이미지와 텍스트의 관계가 변할 수 있는데, UniCLIP은 이를 보정할 수 있는 구조를 갖췄다.

핵심 기술인 Augmentation-aware Projection Head는 다음과 같은 역할을 수행한다:

  • Augmentation Encoder를 통해 적용된 증강 정보를 인코딩한다.
  • 인코딩된 증강 정보와 이미지 특징을 함께 Projection Head로 전달한다.
  • 이를 통해 증강으로 인한 불일치를 임베딩 단계에서 직접 보정한다.

실험 결과, UniCLIP은 CC3M, CC12M, YFCC15M과 같은 오픈 데이터셋에서 기존 CLIP 방식보다 높은 성능을 입증했으며, ImageNet Zero-shot 성능에서도 증강 임베딩을 사용했을 때 더 우수한 결과를 보였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.