AI Agent를 위한 OpenSearch 검색 품질 개선하기 (Part 2)
핵심 내용
Rerank 적용 시 BM25는 개선되지만 하이브리드 검색에서는 최대 9% 성능이 악화되는 것으로 나타났다.
자세히 보기
AI Agent의 검색 품질 개선을 위해 Rerank와 Weight 튜닝을 실험한 결과, 기존 검색 성능이 높을수록 Rerank가 오히려 성능을 저하시키는 것으로 확인됐다. 특히 이미 의미 정보가 포함된 Hybrid 검색에 Rerank을 적용할 경우, SciFact 데이터셋에서 -3.8%, Touche-2020 데이터셋에서 **-8.9%**의 NDCG@10 하락이 발생했다.
Rerank 적용 효과의 양면성
Rerank은 초기 검색 후보를 재정렬하는 기법으로, 의미 파악이 약한 BM25 단독 검색에서는 SciFact 데이터셋 기준 **+18.9%**의 큰 성능 향상을 보였다. 그러나 Hybrid 검색처럼 이미 시멘틱 정보가 반영된 상태에서는 추가 정보 없이 순서만 변경되어 성능이 악화됐다. 이는 Cohere Rerank 모델이 의미적 유사성 기준으로 순서를 바꾸기 때문이다.
가중치 튜닝과 통계적 유의성
Weight 튜닝은 추가 API 호출 비용 없이 BM25와 k-NN 점수의 정규화 가중치를 조정하는 방식이다. Touche-2020 데이터셋에서 Grid Search를 수행한 결과, 기본값인 0.5:0.5 비율(NDCG@10 0.8039)이 12개 테스트 비율 중 최고 성능을 기록했다. BM25(0.778)와 k-NN(0.757)의 성능 차이가 크지 않아 기본 비율이 이미 최적점인 것으로 분석됐다. 대응표본 t-검정 결과 p-value가 0.64로, 튜닝된 설정과 기본 설정 간 통계적 유의미한 차이가 없었다.
운영 환경에서의 자동화 및 평가 시스템
검색 품질 변동에 대응하기 위해 Amazon EventBridge와 Lambda를 활용한 주기적 평가 루프를 구축했다. 주간 단위로 대표 쿼리셋을 질의하여 NDCG@10을 계산하고, 임계값(0.6) 미달 시 Amazon SNS로 알림을 전송한다. 또한 배포 파이프라인에 품질 게이트를 삽입하여 NDCG가 기준선(0.65) 아래로 떨어지면 배포를 자동 중단하도록 설계했다. Self-RAG와 같은 실시간 파이프라인 개선도 제안했으나, 지연 시간과 비용 증가를 고려해 측정 기반의 적용이 필수임을 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.