Sentence Transformers, ColBERT 스타일 지원
Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers
·2026.08.18 09:00
핵심 내용
Sentence Transformers v6.0 업데이트를 통해 ColBERT 방식의 Multi-Vector 임베딩 모델 지원이 추가되었다.
자세히 보기
Sentence Transformers v6.0 업데이트에서 새로운 모델 타입인 MultiVectorEncoder가 도입되었다. 이는 ColBERT 스타일의 Late Interaction(지연 상호작용) 검색을 지원한다.
기존의 Dense 임베딩 모델은 텍스트 전체를 하나의 고정된 크기 벡터로 압축하여 정보 손실이 발생할 수 있는 반면, Multi-Vector 모델은 각 토큰의 임베딩을 유지하며 MaxSim(Maximum Similarity) 연산자를 사용하여 쿼리와 문서 간의 정교한 매칭을 수행한다.
주요 특징은 다음과 같다:
- 검색 품질 향상: 복합적인 요구사항이 포함된 쿼리나 특정 엔티티(제품 코드, 성씨 등) 매칭에서 기존 모델보다 뛰어난 성능을 보인다.
- 시각적 문서 검색(Visual Document Retrieval): OCR 과정 없이 페이지 이미지에서 텍스트 쿼리를 직접 매칭하는 SOTA(State-of-the-art) 기능을 지원한다.
- 높은 호환성: PyLate 및 Stanford-NLP ColBERT 체크포인트를 기존의 익숙한 API로 즉시 로드하여 사용할 수 있다.
이 방식은 단일 벡터 모델보다 인덱스 크기가 커지는 비용이 발생하지만, 검색 정확도를 극대화해야 하는 RAG(검색 증강 생성) 및 시맨틱 검색 시스템 구축에 매우 유용하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.