Kapa, 기업 데이터 검색 벤치마크 공개… 최적화 에이전트 0.65점 달성
핵심 내용
Kapa가 공개한 벤치마크에서 최적화된 에이전틱 리트리버가 5.1초 만에 0.65점을 달성했다.
자세히 보기
Kapa가 실제 기업 데이터를 대상으로 검색 시스템의 성능을 측정하는 비공개 벤치마크 Company Knowledge Bench를 공개했다. 기존 공개 벤치마크가 좁은 영역이나 합성 데이터에 집중했던 것과 달리, 이 벤치마크는 개발, 영업, 지원 등 실제 프로덕션 쿼리에서 추출한 1,000개 평가 사례를 활용한다.
벤치마크 방법론
검색 성능은 다음 세 가지 핵심 속성을 기준으로 평가된다:
- 완전성(Completeness): 검색된 청크가 쿼리에 대한 답변을 완전히 포함해야 한다.
- 최소성(Minimality): 비용 증가와 추론 난이도 상승을 막기 위해 불필요한 청크는 포함되지 않아야 한다.
- 소스 선호도(Source Preference): 커뮤니티 포럼 게시물보다 공식 레퍼런스 페이지처럼 권위 있고 최신인 소스를 우선시해야 한다.
Kapa는 170개의 인간 라벨링된 평가 사례로 검증된 2단계 에이전트 프로세스를 통해 벤치마크를 구축했다. 후보 에이전트가 관련 청크를 스캔하고, 기준 에이전트가 엄격한 핸드북에 따라 최종 검색 기준을 생성한다.
검색 성능 결과
Kapa는 전통적인 RAG 파이프라인부터 에이전틱 접근법까지 7가지 검색 전략을 테스트했으며, 정확도, 지연 시간, 비용 간의 상당한 트레이드오프를 확인했다:
- 하이브리드 검색 (기준): 가장 낮은 지연 시간(0.4초)을 기록했지만 점수는 0.41로 정밀도가 낮았다.
- 하이브리드 검색 + 리랭크:
rerank-2를 추가해 점수를 0.50으로 높였고, 지연 시간은 0.7초로 소폭 증가했다. - 쿼리 분해:
gpt-6.1-luna를 사용해 쿼리를 분해하면 점수가 0.56으로 개선되지만, 지연 시간이 1.8초로 두 배가 된다. - 에이전틱 리트리버:
gpt-6.1-sol과 grep 도구를 조합하면 점수는 0.61이지만 지연 시간이 17초로 길고 정밀도는 **4%**에 불과하다.gpt-6.1-luna는 0.54점을 기록했다. - Kapa Default: 고정 파이프라인은 3.3초에 0.61점, 정밀도 **26%**를 달성했다.
- Kapa Deep: 최적화된 에이전틱 리트리버는 약 5초에 최고 점수인 0.65와 최고 정밀도(26%)를 기록했다.
비용 및 효율성
에이전틱 리트리버는 토큰 사용량으로 인해 비용이 높을 수 있다. gpt-6.1-sol grep 에이전트는 쿼리당 약 40,000개의 토큰을 반환하며, 입력 토큰 비용만 1,000 쿼리당 약 $77.58(입력 $2/M 가정)이 든다. 반면 Kapa Deep은 더 적은 토큰을 반환해 1,000 쿼리당 약 $10.20의 비용이 든다. 벤치마크는 최적화된 에이전틱 검색이 정확도, 지연 시간, 비용의 균형을 가장 잘 맞춘다고 결론지었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.