다국어 시각 문서 검색 모델 공개
Visual Document Retrieval Goes Multilingual
·2025.01.10 09:00
LlamaIndex와 협업하여 개발한 다국어 시각 문서 검색용 임베딩 모델과 50만 건의 데이터셋이 공개되었다.
vdr-2b-multi-v1은 문서 페이지 스크린샷을 밀집 벡터(dense vector)로 인코딩하여, OCR이나 데이터 추출 과정 없이도 시각적으로 풍부한 다국어 문서를 검색할 수 있게 설계된 임베딩 모델이다. LlamaIndex와의 협업을 통해 개발되었으며, 기존 모델보다 강력한 성능을 제공한다.
주요 특징은 다음과 같다:
- 다국어 지원: 이탈리아어, 스페인어, 영어, 프랑스어, 독일어를 지원하며, 이를 위해 50만 개의 고품질 멀티링구얼 합성 데이터셋(vdr-multilingual-train)을 함께 공개했다.
- 효율적인 추론: 기존 모델 대비 3배 빠른 추론 속도와 낮은 VRAM 사용량을 제공한다.
- 교차 언어 검색: 이탈리아어 쿼리로 독일어 문서를 찾는 등의 교차 언어 검색이 가능하다.
- Matryoshka Representation Learning: 벡터 크기를 3배 줄여도 품질의 98%를 유지할 수 있어 저장 비용과 검색 속도를 최적화할 수 있다.
이 모델은 LlamaIndex 및 SentenceTransformers와 직접 통합되어 쉽게 사용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.