Granite 다국어 임베딩 R2 공개
Granite Embedding Multilingual R2: Open Apache 2.0 Multilingual Embeddings with 32K Context — Best Sub-100M Retrieval Quality
·2026.05.15 03:55
핵심 내용
IBM Granite가 97M·311M 다국어 임베딩 R2를 Apache 2.0으로 공개했다.
1 / 2
자세히 보기
IBM Granite가 97M·311M 다국어 임베딩 모델 R2를 공개했다. 두 모델은 Apache 2.0 라이선스이며, 200+ 언어와 9개 프로그래밍 언어 코드 검색을 지원하고 32,768 tokens 컨텍스트를 처리한다.
- granite-embedding-97m-multilingual-r2는 97M 파라미터, 384-dim 임베딩으로 MTEB Multilingual Retrieval 60.3을 기록했다.
- granite-embedding-311m-multilingual-r2는 311M 파라미터, 768-dim 임베딩으로 65.2를 기록했고, Matryoshka로 512/384/256/128 차원 축소를 지원한다.
- 52개 언어와 코드에 대해 retrieval/cross-lingual training을 추가했고,
sentence-transformers,transformers,LangChain,LlamaIndex,Haystack,Milvus에서 모델명만 바꿔 바로 붙일 수 있다. - 311M은 22-layer ModernBERT 기반으로 지식 증류, contrastive fine-tuning, checkpoint merging, Matryoshka로 학습됐고, 97M은 vocabulary pruning과 지식 증류로 경량화했다.
- 학습 데이터는 IBM-curated 데이터, 공개 웹 데이터, 합성 데이터를 섞었으며 MS-MARCO와 비상업 라이선스 데이터는 제외했다.
- CPU 추론용 ONNX와 OpenVINO 가중치도 제공된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.