텐센트, WeMM-Embedding 공개
WeMM-Embedding: 2B 모델로 8B 베이스라인을 넘어선 범용 멀티모달 임베딩에 대한 연구
·2026.08.29 18:30
핵심 내용
텐센트 WeChat Vision 팀이 2B 파라미터로 8B 베이스라인을 능가하는 범용 멀티모달 임베딩 모델 WeMM-Embedding을 공개했다.
1 / 4
자세히 보기
텐센트 WeChat Vision 팀이 텍스트, 이미지, 영상, 시각 문서를 하나의 벡터 공간으로 통합하는 범용 멀티모달 임베딩 모델군 WeMM-Embedding을 공개했다. 이 모델은 Apache 2.0 라이선스로 가중치와 코드가 오픈소스로 배포되었다.
성능 및 특징
WeMM-Embedding은 Qwen3.5 아키텍처를 기반으로 하며, 2B, 4B, 9B 세 가지 규모로 제공된다. 가장 작은 2B 모델이 벤치마크 MMEB-v2에서 77.9점을 기록해 기존 최상위 8B 오픈소스 베이스라인을 앞질렀으며, 9B 모델은 80.6점으로 공식 리더보드 1위에 올랐다. WeChat 사내 26개 과제 벤치마크와 14건의 온라인 A/B 테스트를 통해 실제 서비스 환경에서도 성능이 유지됨을 검증했다.
학습 전략
학습은 넓은 커버리지를 확보하는 1단계 대규모 정렬과, 정제된 데이터로 세밀한 매칭 능력을 높이는 2단계 정제 학습으로 구성된다.
- 데이터 구축: 약한 감독 쌍, 캡션, 검색, 분류, 멀티모달 QA, 등급 관련도 쌍 등 6가지 유형의 데이터를 통일된 쌍 형식으로 변환하여 학습한다.
- 정제 과정: 시맨틱 ID 기반 리샘플링으로 의미 분포를 균일화하고, MLLM을 활용해 데이터 품질을 정제하며, 하드 네거티브(hard negative)를 구축해 판별력을 강화한다.
- 표현 추출: 입력 시퀀스 끝에
<embedding>토큰을 추가하고, 해당 토큰의 마지막 레이어 은닉 상태를 출력 표현으로 사용한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.