LG AI Research: UniCLIP 기술 소개
UniCLIP은 도메인 내외의 contrastive learning을 하나의 프레임워크로 통합하여 데이터 효율성을 높인 기술이다.
기존의 CLIP은 이미지-텍스트 쌍을 활용해 뛰어난 성능을 보였으나, 이미지-이미지(intra-domain)와 이미지-텍스트(inter-domain) 간의 contrastive loss가 분리되어 정의된다는 한계가 있었다.
UniCLIP은 이를 극복하기 위해 모든 도메인의 contrastive learning을 하나의 통합된 임베딩 공간에서 정의하는 프레임워크를 제안한다. 특히 이미지 augmentation 과정에서 발생하는 misalignment 문제를 해결하기 위해 augmentation-aware projection head 구조를 도입했다.
이 구조는 augmentation encoder를 통해 이미지에 적용된 변형 정보를 인코딩하고, 이를 projection head에 전달하여 misalignment를 효과적으로 수정한다. 실험 결과, augmentation 정보를 반영했을 때 ImageNet zero-shot 성능이 향상됨을 확인했다.
또한, 하나의 통합 공간에서 여러 개의 positive 샘플이 존재하는 상황을 처리하기 위해 기존 InfoNCE loss를 확장한 MP-NCE (Multi-Positive NCE) loss를 제안했다. MP-NCE는 MIL-NCE나 SupCon loss보다 우수한 성능을 보이며, 도메인 간 loss 밸런스를 조절하는 하이퍼파라미터 $w$를 통해 학습 효율을 높였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.