디코더 전용 멀티모달 임베딩 'UEmbed' 공개
UEmbed: 디코더 전용 모델에서 희소 검색과 밀집 검색을 통합한 멀티모달 임베딩 연구
·2026.08.14 17:00
핵심 내용
디코더 전용 모델에서 희소·밀집 검색을 단 한 번의 순전파로 통합한 멀티모달 임베딩 모델 UEmbed 연구가 발표되었다.
자세히 보기
UEmbed는 중국과학원(CASIA), Alibaba, Yale 대학 연구진이 개발한 멀티모달 임베딩 모델로, 디코더 전용(Decoder-only) 구조를 유지하면서 희소(Sparse) 검색과 밀집(Dense) 검색을 단 한 번의 순전파로 동시에 수행한다.
기존의 학습된 희소 검색(LSR) 모델들이 주로 양방향 인코더(BERT 등)에 의존하거나 텍스트에 국한되었던 한계를 극복하기 위해, 인과적 어텐션(Causal Attention) 하에서도 효과적으로 작동하도록 설계되었다.
핵심 기술: 어휘 분할(Vocabulary Splitting) 단일 토큰이 거대한 어휘 공간을 감당할 때 발생하는 정보 병목 현상을 해결하기 위해, 16개의 학습 가능한 특수 토큰을 도입했다. k-means 군집화를 통해 어휘를 16개 부분집합으로 나누고, 각 특수 토큰이 자기 몫의 어휘 조각만을 담당하게 하여 완전한 희소 벡터를 생성한다. 밀집 임베딩은 특수 토큰 직전의 EOS 토큰의 은닉 상태를 활용한다.
주요 성과
- MMEB-v2 벤치마크에서 밀집 모드 71.8점, 희소 모드 71.0점을 기록했다.
- MMEB-v2에서 희소 멀티모달 검색 결과가 보고된 것은 이번이 처음이다.
- 희소 모드 성능만으로도 기존의 여러 밀집 전용 모델을 상회하는 결과를 보였다.
- 2B, 4B, 9B 세 가지 크기의 가중치가 함께 공개되었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.