Pinterest의 임베딩 검색 플랫폼 진화
핵심 내용
Pinterest이 Manas 플랫폼의 양자화와 SSD 서빙 도입으로 임베딩 검색 비용을 최대 30% 절감했다.
자세히 보기
Pinterest의 분산 검색 플랫폼 Manas가 임베딩 검색의 비용과 성능 한계를 극복하기 위해 세 가지 핵심 기술 개선을 적용했다. 기존 HNSW 방식은 전체 인덱스를 RAM에 상주시켜 코퍼스 크기에 비례해 비용이 증가하는 문제가 있었다.
양자화 및 SSD 기반 서빙
**Scalar Quantization(SQ)**을 적용해 임베딩 인덱스 메모리를 50% 이상 절감하고 서빙 인프라 비용을 20~30% 줄였다. 1억 개 GraphSage 데이터셋 벤치마크에서 SQ는 PQ 대비 압축률과 recall의 균형이 우수했으며, HNSW 인덱스 크기를 59%, IVF 인덱스를 75% 축소하면서 recall 90% 이상을 유지했다.
또한 RAM 대신 NVMe SSD에서 ANN 쿼리를 서빙하는 방식을 도입했다. 초기 실험에서 메모리 사용량을 10배 줄이고 CPU를 40% 절감했다. 특히 SPANN 아키텍처에 PQ 양자화를 결합해 디스크 저장 공간을 최적화했으며, 원본 SPANN 대비 속도를 4.5배 향상시키고 DiskANN 대비 QPS를 3배 이상 높였다.
멀티 임베딩 검색 지원
단일 벡터로만 표현하던 Two-Tower 모델의 한계를 극복하기 위해 **Late Interaction 모델(ColBERT 등)**을 도입했다. 문서와 쿼리를 벡터 리스트로 표현하고 Sum of MaxSim 스코어링 로직을 적용해 토큰 단위 세분화된 의미를 보존한다. 현재 Manas 쿼리 파서를 업데이트해 멀티 임베딩 쿼리를 지원하며, 파일럿 테스트를 진행 중이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.