AI Briefing

Sentence Transformers v6.0, 멀티 벡터 검색 지원

Sentence Transformers v6.0, ColBERT 스타일 멀티 벡터 검색을 표준 API로

·2026.08.21 12:30

핵심 내용

Sentence Transformers v6.0이 ColBERT 기반 멀티 벡터 검색을 표준 API로 통합해 RAG 성능을 높였다.

자세히 보기

Sentence Transformers v6.0이 네 번째 모델 유형인 MultiVectorEncoder를 추가하여 ColBERT 계열의 Late Interaction 검색을 표준 API로 지원한다. 기존 PyLate 및 Stanford-NLP ColBERT 체크포인트를 그대로 사용할 수 있으며, 페이지 이미지 검색에 쓰이는 colpali-engine 계열 모델도 동일한 API로 동작한다.

일반적인 밀집(Dense) 임베딩 모델이 문장을 단일 벡터로 압축하는 반면, 멀티 벡터 모델은 토큰 단위 벡터를 보존하여 검색 품질을 높인다. 이는 드문 고유명사나 복잡한 조건이 포함된 질의에서 정확도를 개선하지만, 색인 크기가 커지는 것이 대가다. 예를 들어 Natural Questions 문단 4,874개를 인코딩할 때 밀집 모델 대비 약 42배 큰 색인이 생성되나, fast-plaid와 같은 압축 기술 적용 시 기존 밀집 색인과 유사한 용량으로 관리 가능하다.

이 업데이트는 LightOn의 PyLate 생태계와 Sentence Transformers를 하나로 통합하여, 개발자가 별도 라이브러리 학습 없이도 고성능 검색을 구축할 수 있게 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.