Granite 다국어 임베딩 R2 공개
Granite Embedding Multilingual R2: Open Apache 2.0 Multilingual Embeddings with 32K Context — Best Sub-100M Retrieval Quality
·2026.05.15 03:55
IBM Granite가 97M·311M 다국어 임베딩 R2를 Apache 2.0으로 공개했다.
IBM Granite가 97M·311M 다국어 임베딩 모델 R2를 공개했다. 두 모델은 Apache 2.0 라이선스이며, 200+ 언어와 9개 프로그래밍 언어 코드 검색을 지원하고 32,768 tokens 컨텍스트를 처리한다.
- granite-embedding-97m-multilingual-r2는 97M 파라미터, 384-dim 임베딩으로 MTEB Multilingual Retrieval 60.3을 기록했다.
- granite-embedding-311m-multilingual-r2는 311M 파라미터, 768-dim 임베딩으로 65.2를 기록했고, Matryoshka로 512/384/256/128 차원 축소를 지원한다.
- 52개 언어와 코드에 대해 retrieval/cross-lingual training을 추가했고,
sentence-transformers,transformers,LangChain,LlamaIndex,Haystack,Milvus에서 모델명만 바꿔 바로 붙일 수 있다. - 311M은 22-layer ModernBERT 기반으로 지식 증류, contrastive fine-tuning, checkpoint merging, Matryoshka로 학습됐고, 97M은 vocabulary pruning과 지식 증류로 경량화했다.
- 학습 데이터는 IBM-curated 데이터, 공개 웹 데이터, 합성 데이터를 섞었으며 MS-MARCO와 비상업 라이선스 데이터는 제외했다.
- CPU 추론용 ONNX와 OpenVINO 가중치도 제공된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.