AI Briefing

[NeurIPS 2022] 교차 모달 유사성 매칭을 통한 사전 학습된 멀티모달 표현 전이

·2026.07.16 09:00

대규모 멀티모달 모델 CLIP의 표현력을 작은 모델로 효율적으로 전이하는 BeamCLIP 기술을 소개한다.

대규모 이미지-텍스트 쌍 데이터로 학습된 CLIP은 뛰어난 제로샷 성능을 보이지만, 막대한 컴퓨팅 자원과 시간이 소요된다는 한계가 있다.

이를 해결하기 위해 LG AI Research는 대규모 모델의 표현력을 ResNet-18과 같은 작은 타겟 모델로 전이하는 BeamCLIP을 제안한다. BeamCLIP은 레이블이 없는 이미지에 대해 스튜던트 모델이 티처 모델의 벡터 표현을 회귀하도록 학습하는 비지도 표현 전이 방식이다.

핵심 기술로는 두 가지 방법론이 사용된다:

  • Cross-modal Similarity Matching (CSM): 유사성 기반 벡터 회귀에서 발생할 수 있는 위상적 모호성을 완화한다.
  • Context-based Prompt Augmentation (CPA): 어휘적 모호성 없이 텍스트 프롬프트를 적절히 인코딩한다.

실험 결과, BeamCLIP은 ResNet-18의 ImageNet top-1 linear probe 정확도에서 **66.2%**를 달성하며, 기존의 시각 기반 자기지도 학습(SSL) 방식인 SimCLR(51.8%)이나 SwAV(63.7%)보다 우수한 성능을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.