마이크로소프트·허깅페이스, ThinkingBox 에이전트 벤치마크 출시
The Agent Said It Was Done. The Database Disagreed.
핵심 내용
마이크로소프트와 허깅페이스가 백엔드 상태 검증 기반 에이전트 벤치마크 ThinkingBox를 공개했다.
자세히 보기
마이크로소프트와 허깅페이스가 AI 에이전트의 최종 백엔드 상태와 부작용을 평가하는 새로운 벤치마크 및 샌드박스 환경 ThinkingBox를 공개했다. 기존 평가 방식은 도구 호출 성공 여부나 최종 응답만 확인했지만, ThinkingBox는 데이터베이스 상태가 실제로 올바른지 검증하여 에이전트 신뢰성의 핵심 공백을 메운다.
벤치마크 구조 및 방법론
이 벤치마크는 리테일(98개), 자동차 보험(100개), 여행(104개), 네오뱅크(104개), 컨설팅(101개) 등 5개 도메인의 507개 상태 기반 비즈니스 워크플로로 구성된다. 각 작업은 초기화된 상태에서 공유 데이터베이스 행 없이 격리된 MCP 도구 세션에서 실행되며, 다음 세 가지 지표로 평가된다.
- pass@1: 단일 시도 성공률
- pass@20: 20회 중 최소 1회 성공
- Observed 20/20: 20회 모두 성공
평가는 백엔드의 실제 변경 사항을 식별하는 side-effect extractor와 이를 요구된 최종 상태와 비교하는 deterministic judge를 사용한다. 잘못된, 누락된, 또는 불필요한 부작용은 실패로 간주된다.
주요 발견: 도구 호출은 결과가 아니다
12개 LLM과 121,680회 유효 시도를 포함한 애블레이션 연구 결과, **67.24%**의 실패가 에이전트가 오류 없이 종료하고 상태 변경 도구를 호출했음에도 발생했다. 이러한 조용한 실패의 주요 원인은 다음과 같다.
- 잘못된 필드 값: 77.61%
- 의도치 않은 추가 부작용: 43.30%
- 필수 부작용 누락: 25.36%
전체 실패의 약 **80%**는 추론 오류가 아닌 도구 처리 문제로 귀결되어, 도구 오류 복구, 전제 조건 실패, 빈 조회 처리의 어려움을 드러냈다.
모델 성능 및 신뢰성
벤치마크는 커버리지(최소 한 번 해결 능력)와 일관성(안정적으로 해결 능력) 간의 트레이드오프를 보여준다.
- 최고의 독점 모델: Claude Opus 5.5가 pass@1 **67.16%**로 1위를 차지했으며, Claude Opus 5(66.50%)와 GPT-5.4(65.36%)가 뒤를 이었다.
- 최고의 오픈 웨이트 모델: Kimi-K3가 pass@1 **57.37%**로 오픈 웨이트 모델 중 선두를 기록했다.
- 일관성 대 커버리지: Kimi-K3는 pass@20 **93.89%**로 가장 넓은 커버리지를 보였으나 Observed 20/20은 **13.41%**로 일관성이 낮았다. 반면 Claude Opus 5는 pass@20 **79.09%**로 커버리지는 낮았지만 Observed 20/20 **47.53%**로 일관성이 높았다.
- 도메인별 편차: 리테일 평균 pass@1은 **59.52%**인 반면, 자동차 보험은 **33.83%**로 도메인별 성능 차이가 두드러졌다.
비용 분석
OpenRouter 목록 가격을 기준으로 단일 성공당 비용과 신뢰할 수 있는 작업(20/20 성공률)당 비용을 분석했다.
- 단일 성공당 최저 비용: GPT-5.6 Sol ($0.127)
- 신뢰할 수 있는 성공당 최저 비용: GPT-5.4 ($6.80)
- Claude Opus 5.5: 단일 성공당 $0.276, 신뢰할 수 있는 작업당 $7.80
- Kimi-K3: 시도당 비용은 낮았으나 일관성이 낮아 신뢰할 수 있는 작업당 비용이 $20.68로 높게 나타났다.
단일 성공당 비용이 가장 낮은 모델(GPT-5.6 Sol)이 반복적이고 신뢰할 수 있는 운영에는 가장 비용 효율적이지 않다는 점을 데이터가 시사한다.
배포 및 리소스
ThinkingBox는 허깅페이스에서 OpenEnv 인터페이스로 제공된다. 코드는 MIT 라이선스, 벤치마크 데이터는 CDLA-Permissive-2.0, OpenEnv 환경은 BSD-3-Clause 라이선스를 따른다. 본 프로젝트는 마이크로소프트 Copilot Studio 팀이 Toloka, 피츠버그 대학교, 노스웨스턴 대학교, 컬럼비아 대학교, UC 어바인과 협력하여 개발했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.