AI Briefing

Perplexity, 텍스트 및 시각 문서용 멀티 벡터 임베딩 모델 pplx-embed-v2-late 공개

·2026.10.08 09:00

핵심 내용

Perplexity가 텍스트와 시각 문서를 지원하는 멀티 벡터 임베딩 모델 pplx-embed-v2-late를 공개했다.

자세히 보기

Perplexity가 0.6B와 9B 매개변수 크기의 late-interaction 임베딩 모델 'pplx-embed-v2-late'를 공개했습니다. 이 모델은 ColBERT 아키텍처를 기반으로 하며, 128차원 토큰 임베딩과 MaxSim 스코어링 함수를 통해 쿼리와 문서 부분 간의 정밀한 매칭을 지원합니다. 텍스트와 이미지 모달리티를 모두 지원하여 OCR 파이프라인 없이 시각적 문서에서 직접 검색할 수 있습니다. 학습은 594개 데이터셋의 1억 8600만 쿼리-문서 쌍에 대해 18B 교사 모델로부터 LEAF 스타일 표현 증류를 수행하는 방식으로 진행되었습니다. 0.6B 모델은 Qwen3.5-0.8B를 기반으로 하며 텍스트 타워를 12층으로 가지치기(pruning)했습니다. 두 모델은 임베딩 공간을 공유하므로, 9B 모델로 색인된 코퍼스를 0.6B 모델로 쿼리하는 비대칭 검색이 가능합니다. 해당 모델은 Hugging Face에서 제공되며 sentence-transformers >= 6.0.0 및 transformers >= 5.4.0과 호환됩니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.