AI Briefing

Qwen3 Embedding: 파운데이션 모델로 텍스트 임베딩과 reranking 고도화

·2025.06.05 22:00

핵심 내용

Qwen3 기반 임베딩·reranker 시리즈가 다국어 검색 성능을 끌어올렸다.

1 / 2

자세히 보기

Qwen3 Embedding 시리즈는 텍스트 임베딩, retrieval, reranking에 특화된 새 모델군으로, Qwen3 foundation model 위에서 만들어졌다. 다국어 이해 능력을 바탕으로 여러 벤치마크에서 SOTA 수준의 성능을 목표로 하며, Hugging Face와 ModelScope에 Apache 2.0 라이선스로 공개됐다.

임베딩 모델과 reranker 모델은 각각 0.6B, 4B, 8B 크기로 제공된다. 임베딩 쪽은 1024 / 2560 / 4096 차원의 벡터를 지원하고, 32K sequence length와 MRL Support, Instruction Aware를 갖췄다.

성능 측면에서 reranking 모델은 MTEB 계열 retrieval 벤치마크에서 강한 결과를 보였다. 예를 들어 Qwen3-Reranker-4B는 MTEB-R 69.76, FollowIR 14.84를 기록했고, Qwen3-Reranker-8B는 CMTEB-R 77.45, MMTEB-R 72.94, MLDR 70.19로 최고 성능을 달성했다.

주요 특징은 다음과 같다.

  • Exception al versatility: 8B 임베딩 모델은 2025년 6월 5일 기준 MTEB multilingual leaderboard에서 **1위(70.58)**를 기록했다.
  • Comprehensive flexibility: 임베딩과 reranking 모두 다양한 크기를 제공하며, 사용자 정의 instruction으로 작업·언어·시나리오에 맞춰 조정할 수 있다.
  • Multilingual capability: 100개 이상 언어와 프로그래밍 언어를 지원하며, multilingual, cross-lingual, code retrieval에 강하다.

아키텍처는 dual-encoder와 cross-encoder를 사용한다. 임베딩 모델은 단일 텍스트를 입력받아 최종 [EOS] 토큰의 hidden state를 대표 벡터로 사용하고, reranker는 쿼리와 문서 같은 텍스트 쌍을 입력받아 relevance score를 계산한다.

학습은 GTE-Qwen 계열의 multi-stage 방식을 따른다. 임베딩 모델은 weakly supervised data로 하는 contrastive pre-training, 고품질 labeled data의 supervised training, 그리고 후보 모델을 합치는 merging 전략의 3단계로 학습했고, reranker는 고품질 labeled data를 바로 사용해 supervised training을 수행했다.

특히 1단계에서는 Qwen3의 text generation 능력을 활용해 task와 언어별 weakly supervised text pairs를 동적으로 생성하는 prompt 시스템을 도입했다. 커뮤니티 포럼이나 공개 데이터에 의존하던 기존 방식의 한계를 줄이면서 대규모 학습 데이터를 효율적으로 만들었다.

향후에는 Qwen foundation model의 최적화를 통해 임베딩과 reranking 학습 효율 및 배포 성능을 더 높이고, multimodal representation으로 확장해 cross-modal semantic understanding까지 넓혀갈 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.