AI Briefing

Granite 다국어 임베딩 R2 공개

Granite Embedding Multilingual R2: Open Apache 2.0 Multilingual Embeddings with 32K Context — Best Sub-100M Retrieval Quality

·2026.05.15 03:55

IBM Granite가 97M·311M 다국어 임베딩 R2를 Apache 2.0으로 공개했다.

IBM Granite가 97M·311M 다국어 임베딩 모델 R2를 공개했다. 두 모델은 Apache 2.0 라이선스이며, 200+ 언어9개 프로그래밍 언어 코드 검색을 지원하고 32,768 tokens 컨텍스트를 처리한다.

  • granite-embedding-97m-multilingual-r297M 파라미터, 384-dim 임베딩으로 MTEB Multilingual Retrieval 60.3을 기록했다.
  • granite-embedding-311m-multilingual-r2311M 파라미터, 768-dim 임베딩으로 65.2를 기록했고, Matryoshka512/384/256/128 차원 축소를 지원한다.
  • 52개 언어와 코드에 대해 retrieval/cross-lingual training을 추가했고, sentence-transformers, transformers, LangChain, LlamaIndex, Haystack, Milvus에서 모델명만 바꿔 바로 붙일 수 있다.
  • 311M은 22-layer ModernBERT 기반으로 지식 증류, contrastive fine-tuning, checkpoint merging, Matryoshka로 학습됐고, 97M은 vocabulary pruning과 지식 증류로 경량화했다.
  • 학습 데이터는 IBM-curated 데이터, 공개 웹 데이터, 합성 데이터를 섞었으며 MS-MARCO와 비상업 라이선스 데이터는 제외했다.
  • CPU 추론용 ONNXOpenVINO 가중치도 제공된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.