교차 모달 유사도 매칭을 통한 사전 학습된 멀티모달 표현 전이
·2026.07.16 09:00
핵심 내용
대규모 멀티모달 모델의 표현력을 소규모 타겟 모델로 효율적으로 전이하는 BeamCLIP 방법론을 제안한다.
1 / 2
자세히 보기
기존의 CLIP과 같은 대규모 멀티모달 모델은 뛰어난 제로샷 성능을 보이지만, 학습을 위해 막대한 데이터와 연산 능력이 필요하다는 한계가 있다. 이를 해결하기 위해 BeamCLIP은 대규모 모델의 표현(representation)을 ResNet-18과 같은 소규모 타겟 모델로 전이하는 방법을 제시한다.
BeamCLIP은 비지도 표현 전이(unsupervised representation transfer) 방식으로, 학생 모델이 교사 모델의 벡터 표현을 회귀(regress)하도록 학습한다. 이 과정에서 두 가지 핵심 기술을 사용한다.
- Cross-modal Similarity Matching (CSM): 위상적 모호성(topological ambiguity) 문제를 완화하기 위해 사용된다.
- Context-based Prompt Augmentation (CPA): 어휘적 모호성 없이 텍스트 프롬프트를 적절히 인코딩하기 위해 사용된다.
실험 결과, BeamCLIP은 ImageNet-1K top-1 linear probe 성능에서 **66.2%**를 기록하며, 기존의 비전 기반 자기지도 학습(SSL) 방식인 **SimCLR(51.8%)**이나 **SwAV(63.7%)**보다 우수한 성능을 입증했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.