Exa, 에이전트 검색 평가용 ATLAS 벤치마크 공개
핵심 내용
ATLAS 벤치마크 결과, $1 예산 내 row F1 0.5 초과 에이전트 없음.
자세히 보기
Exa가 AI 에이전트의 검색 정확도와 완전성을 평가하기 위한 새로운 벤치마크 ATLAS(Agentic Tasks for Large Aggregation + Search)를 공개했다. 기존 벤치마크의 암기율과 포화 문제를 해결하기 위해, GPT-6 Astra, GPT-5.6 Sol, Claude Opus 5 등 프론티어 모델이 내부 지식만으로 답할 수 없는 심층 웹 탐색 작업을 중심으로 설계됐다.
비용 및 성능 주요 발견
효율적인 에이전트 검색에서 큰 격차가 드러났다. 예산 $1 미만으로 실행했을 때 row F1 점수 0.5를 넘긴 에이전트는 없었다. 가장 비싼 검색 에이전트조차 정답 결과의 약 3분의 1을 놓쳐 완전성 측면에서 개선 여지가 크다. 모델 하네스를 고정하면 검색 백엔드 선택이 성능에 큰 영향을 미치며, Exa는 비용 대비 성능 파레토 프론티어를 정의하고 백엔드에 따라 최대 **16%**의 점수 차이를 보였다.
벤치마크 설계 및 지표
ATLAS는 익명화된 검색 수요 클러스터에서 생성된 547개의 심층 및 광범위 연구 작업으로 구성된다. 각 작업은 특정 조건을 충족하는 모든 엔티티를 발견하고 2-10개의 멀티홉 속성으로 보강해야 한다. 평가에는 세 가지 F1 지표가 사용된다:
- Discovery F1: 엔티티 발견만 측정
- Item F1: 셀 수준 정확도(발견 및 보강) 측정
- Row F1: 헤드라인 지표로, 행의 모든 셀이 정확해야 함
채점은 효율적이고 결정적이다. 단일 시스템의 547개 작업 전체를 채점하는 데 약 $0.24가 든다. 이는 WANDR의 답변당 $0.88 및 7.6분 소요와 비교해 훨씬 저렴하며, ATLAS는 답변당 $0.0004와 15초가 소요된다.
검증 및 향후 업데이트
데이터셋은 프론티어 모델과 독립 검증을 포함한 다단계 파이프라인으로 구축되어 골든 값 오류율을 0.9% 미만으로 달성했다. ATLAS는 새로운 검색 수요에 따라 3-6개월마다 데이터셋을 재생성하도록 설계됐다. Exa는 향후 몇 주 내에 작업, 골든 테이블, 채점기 세부 정보를 공개할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.