에이전트가 검색 스택을 대체할 수 있을까?
핵심 내용
단순 BM25·embedding에 에이전트를 붙이면 검색 NDCG가 최대 0.453까지 올랐다.
자세히 보기
Amazon ESCI에서 BM25는 0.289, e5 embeddings는 0.314였다. 여기에 GPT-5-mini를 붙여 검색 도구를 쓰게 하자 e5 기준 0.359, BM25 기준 0.385, 두 도구를 함께 쓰면 평균 0.4101(중앙값 0.3743)까지 올라갔다. GPT-5가 두 도구를 모두 쓰면 NDCG 0.453을 기록했다.
에이전트의 행동은 의외로 단순했다. 대부분 각 검색 도구를 한 번씩만 호출했고, 결과가 어긋나면 검색어를 조금 바꿔 다시 묻는 정도였다. 'PVC coupler' 검색 뒤 엉뚱한 결과가 나오자 'PVC pipe coupler'로 재검색하는 식이다. 키워드 검색은 맞고 틀림이 분명해 에이전트가 다음 행동을 쉽게 고를 수 있었다.
탐색을 더 강하게 강제하면 성능은 조금 더 오른다.
- 4회 호출과 중복 금지: mean 0.4290 / median 0.3948
- 이전 질의와 유사도 0.9 초과 금지: mean 0.4308 / median 0.4258
다만 이 접근은 모든 검색 문제에 통하지 않는다. MS MARCO passages에서는 에이전트가 도구를 더 써도 개선이 없었고, 이미 학습된 embedding model이 더 강했다. 저자는 이를 **'finding things'**와 **'Deep Research'**로 나눈다. 전자는 에이전트가 탐색을 보조할 수 있지만, 후자는 모델의 지식 공백을 메워야 하므로 전통적 검색 스택이 여전히 필요하다.
범용 LLM은 검색을 웹 검색처럼 취급해 한 번 질의하고 끝내는 경향이 있지만, SID-1 같은 전용 agentic search model은 검색 품질 자체를 추론 대상으로 삼는다. 이런 서브 에이전트는 메인 LLM이 사용자 과제에 집중하게 하면서, 검색/RAG 스택을 더 유연하게 다루는 방향을 제시한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.