AI Briefing

Qwen3-VL-Embedding과 Qwen3-VL-Reranker: 차세대 멀티모달 검색을 위한 모델

·2026.01.08 05:00

핵심 내용

Qwen이 텍스트·이미지·비디오를 함께 다루는 멀티모달 검색 모델 2종을 공개했다.

자세히 보기

Qwen이 Qwen3-VL-Embedding과 Qwen3-VL-Reranker를 공개했다. 두 모델은 Qwen3-VL 기반 위에 구축돼 텍스트, 이미지, 스크린샷, 비디오를 하나의 프레임워크에서 다루도록 설계됐다.

핵심은 두 단계 검색 구조다. Embedding 모델은 입력을 공통 의미 공간의 벡터로 바꿔 빠르게 후보를 찾고, Reranker는 (Query, Document) 쌍을 함께 인코딩해 더 정밀한 관련도 점수를 매긴다.

  • Embedding: 단일/혼합 모달 입력을 독립적으로 인코딩하는 dual-tower 구조
  • Reranker: Query와 Document를 함께 처리하는 single-tower 구조와 cross-attention 사용
  • 출력 방식: Embedding은 벡터, Reranker는 yes/no 토큰 생성 확률로 점수 산출

모델 사양은 2B와 8B 두 가지다. Embedding 모델은 각각 2048, 4096 차원의 벡터를 제공하고, 32K 시퀀스 길이, quantization support, MRL support, instruction-aware 기능을 지원한다.

평가에서는 Qwen3-VL-Embedding-8B가 MMEB-v2에서 이전 오픈소스 모델과 상용 서비스까지 넘어서는 성능을 보였고, 이미지·visual document·비디오 검색 하위 과제에서 특히 강했다. 다만 텍스트 전용 MMTEB에서는 같은 규모의 텍스트 전용 Qwen3-Embedding보다 성능이 낮았지만, 동급 모델들과 비교하면 여전히 경쟁력이 있다고 설명했다.

Reranker 쪽에서는 모든 모델이 base embedding 모델과 기존 reranker를 꾸준히 앞섰고, 8B가 대부분의 태스크에서 최고 성능을 기록했다. 저자들은 이 조합이 대규모 멀티모달 검색에서 초기 recall과 정밀 재정렬을 함께 강화하는 실용적 해법이라고 강조한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.