AI Briefing

텐센트, WeMM-Embedding 공개

WeMM-Embedding: 2B 모델로 8B 베이스라인을 넘어선 범용 멀티모달 임베딩에 대한 연구

·2026.08.29 18:30

핵심 내용

텐센트 WeChat Vision 팀이 2B 파라미터로 8B 베이스라인을 능가하는 범용 멀티모달 임베딩 모델 WeMM-Embedding을 공개했다.

1 / 4

자세히 보기

텐센트 WeChat Vision 팀이 텍스트, 이미지, 영상, 시각 문서를 하나의 벡터 공간으로 통합하는 범용 멀티모달 임베딩 모델군 WeMM-Embedding을 공개했다. 이 모델은 Apache 2.0 라이선스로 가중치와 코드가 오픈소스로 배포되었다.

성능 및 특징

WeMM-Embedding은 Qwen3.5 아키텍처를 기반으로 하며, 2B, 4B, 9B 세 가지 규모로 제공된다. 가장 작은 2B 모델이 벤치마크 MMEB-v2에서 77.9점을 기록해 기존 최상위 8B 오픈소스 베이스라인을 앞질렀으며, 9B 모델은 80.6점으로 공식 리더보드 1위에 올랐다. WeChat 사내 26개 과제 벤치마크와 14건의 온라인 A/B 테스트를 통해 실제 서비스 환경에서도 성능이 유지됨을 검증했다.

학습 전략

학습은 넓은 커버리지를 확보하는 1단계 대규모 정렬과, 정제된 데이터로 세밀한 매칭 능력을 높이는 2단계 정제 학습으로 구성된다.

  • 데이터 구축: 약한 감독 쌍, 캡션, 검색, 분류, 멀티모달 QA, 등급 관련도 쌍 등 6가지 유형의 데이터를 통일된 쌍 형식으로 변환하여 학습한다.
  • 정제 과정: 시맨틱 ID 기반 리샘플링으로 의미 분포를 균일화하고, MLLM을 활용해 데이터 품질을 정제하며, 하드 네거티브(hard negative)를 구축해 판별력을 강화한다.
  • 표현 추출: 입력 시퀀스 끝에 <embedding> 토큰을 추가하고, 해당 토큰의 마지막 레이어 은닉 상태를 출력 표현으로 사용한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.