Pinterest, 임베딩 검색 플랫폼 Manas의 SSD 서빙 및 양자화 기술로 비용 최대 30% 절감
핵심 내용
Pinterest이 Manas 플랫폼에 SSD 서빙과 양자화 기술을 도입해 서빙 비용을 최대 30% 절감했다.
자세히 보기
Pinterest 엔지니어링 팀이 자체 분산 검색 플랫폼 Manas의 임베딩 검색 스택 진화 과정을 공개했다. 기존 HNSW 기반 아키텍처는 인덱스 전체를 RAM에 적재해야 해 코퍼스 크기에 비례해 비용이 급증하는 한계가 있었다. Pinterest은 이를 해결하기 위해 Quantization, SSD-based Serving, Multi-embedding Retrieval 세 가지 핵심 기술을 도입했다.
메모리 효율성 극대화
벡터를 저비트 정수로 압축하는 양자화 기술은 모든 주요 사용 사례에 적용되어 임베딩 인덱스 메모리를 50% 이상 줄이고 서빙 인프라 비용을 20~30% 절감했다. 1억 개 GraphSage 데이터셋 벤치마크 결과, **Scalar Quantization(SQ)**은 **Product Quantization(PQ)**보다 압축률은 낮지만 90% 이상의 높은 Recall을 유지해 균형이 우수했다. 또한 Linear Scaling SQ 구현으로 디코딩 병목을 제거해 쿼리당 컴퓨팅 자원을 10~15% 추가로 절감했다.
SSD 기반 서빙 아키텍처
인덱스를 RAM 대신 NVMe SSD에서 직접 서빙하는 방식을 도입해 메모리 사용량을 10배 감소시키고 CPU 비용을 40% 절감했다. 특히 SPANN 알고리즘에 PQ를 결합한 최적화 기법은 일반 SPANN 대비 4.5배 빠르며, DiskANN 대비 QPS는 3배 이상 높고 레이턴시는 1/3 수준으로 낮췄다. 50억 개 이상의 Pin 추천 데이터 사전 평가에서도 HNSW 대비 CPU 시간을 40% 이상 줄이면서 Recall 손실을 5% 미만으로 억제했다.
Multi-embedding Retrieval 도입
기존 Two-tower 모델의 단일 벡터 표현 한계를 극복하기 위해 **Late Interaction 모델(ColBERT 등)**을 도입했다. 문서와 쿼리를 벡터 리스트로 표현하고 'Sum of MaxSim' 로직을 적용해 토큰 수준의 풍부한 유사도 스코어링을 지원한다. Manas 서빙 스택은 이러한 멀티 임베딩을 새로운 쿼리 타입으로 통합했으며, 현재 파일럿 사용 사례를 통해 검증 중이다. 향후 SPANN, ColBERT, GPU 기반 검색 시스템(GPU-based search systems)을 적극 수용하여 확장 가능하고 비용 효율적인 아키텍처로 진화할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.