임베딩 양자화로 검색 속도 및 비용 최적화
Binary and Scalar Embedding Quantization for Significantly Faster & Cheaper Retrieval
·2024.03.22 09:00
임베딩 양자화 기술을 통해 벡터 검색의 메모리 사용량과 비용을 줄이고 속도를 높이는 방법을 제시한다.
임베딩은 텍스트, 이미지 등을 n차원 벡터로 표현하여 유사도 검색에 활용되지만, 고차원 float32 임베딩을 대규모로 사용할 경우 막대한 메모리와 비용이 발생한다. 예를 들어 2억 5천만 개의 벡터를 처리하려면 약 1TB의 메모리가 필요하다.
이를 해결하기 위한 두 가지 핵심 양자화 기술을 제안한다:
- Binary Quantization: 각 차원을 1비트로 압축하여 메모리 사용량을 극적으로 줄인다.
- Scalar (int8) Quantization: float32를 int8로 변환하여 정밀도 손실을 최소화하면서 용량을 줄인다.
또한, 양자화된 벡터로 빠르게 후보군을 추출한 뒤 원본 벡터로 다시 순위를 매기는 Rescoring 기법을 결합하여 검색 정확도를 유지하면서도 성능을 극대화할 수 있다. 4,100만 개의 위키피디아 데이터를 활용한 실험을 통해 실제 검색 시나리오에서의 효율성을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.