AI Briefing

임베딩 양자화로 검색 속도 및 비용 최적화

Binary and Scalar Embedding Quantization for Significantly Faster & Cheaper Retrieval

·2024.03.22 09:00

핵심 내용

임베딩 양자화 기술을 통해 벡터 검색의 메모리 사용량과 비용을 줄이고 속도를 높이는 방법을 제시한다.

자세히 보기

임베딩은 텍스트, 이미지 등을 n차원 벡터로 표현하여 유사도 검색에 활용되지만, 고차원 float32 임베딩을 대규모로 사용할 경우 막대한 메모리와 비용이 발생한다. 예를 들어 2억 5천만 개의 벡터를 처리하려면 약 1TB의 메모리가 필요하다.

이를 해결하기 위한 두 가지 핵심 양자화 기술을 제안한다:

  • Binary Quantization: 각 차원을 1비트로 압축하여 메모리 사용량을 극적으로 줄인다.
  • Scalar (int8) Quantization: float32를 int8로 변환하여 정밀도 손실을 최소화하면서 용량을 줄인다.

또한, 양자화된 벡터로 빠르게 후보군을 추출한 뒤 원본 벡터로 다시 순위를 매기는 Rescoring 기법을 결합하여 검색 정확도를 유지하면서도 성능을 극대화할 수 있다. 4,100만 개의 위키피디아 데이터를 활용한 실험을 통해 실제 검색 시나리오에서의 효율성을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.