AI Briefing

마이크로소프트·허깅페이스, ThinkingBox 에이전트 벤치마크 출시

The Agent Said It Was Done. The Database Disagreed.

·2026.10.04 07:56

핵심 내용

마이크로소프트와 허깅페이스가 백엔드 상태 검증 기반 에이전트 벤치마크 ThinkingBox를 공개했다.

1 / 5

자세히 보기

마이크로소프트와 허깅페이스가 AI 에이전트의 최종 백엔드 상태와 부작용을 평가하는 새로운 벤치마크 및 샌드박스 환경 ThinkingBox를 공개했다. 기존 평가 방식은 도구 호출 성공 여부나 최종 응답만 확인했지만, ThinkingBox는 데이터베이스 상태가 실제로 올바른지 검증하여 에이전트 신뢰성의 핵심 공백을 메운다.

벤치마크 구조 및 방법론

이 벤치마크는 리테일(98개), 자동차 보험(100개), 여행(104개), 네오뱅크(104개), 컨설팅(101개) 등 5개 도메인의 507개 상태 기반 비즈니스 워크플로로 구성된다. 각 작업은 초기화된 상태에서 공유 데이터베이스 행 없이 격리된 MCP 도구 세션에서 실행되며, 다음 세 가지 지표로 평가된다.

  • pass@1: 단일 시도 성공률
  • pass@20: 20회 중 최소 1회 성공
  • Observed 20/20: 20회 모두 성공

평가는 백엔드의 실제 변경 사항을 식별하는 side-effect extractor와 이를 요구된 최종 상태와 비교하는 deterministic judge를 사용한다. 잘못된, 누락된, 또는 불필요한 부작용은 실패로 간주된다.

주요 발견: 도구 호출은 결과가 아니다

12개 LLM과 121,680회 유효 시도를 포함한 애블레이션 연구 결과, **67.24%**의 실패가 에이전트가 오류 없이 종료하고 상태 변경 도구를 호출했음에도 발생했다. 이러한 조용한 실패의 주요 원인은 다음과 같다.

  • 잘못된 필드 값: 77.61%
  • 의도치 않은 추가 부작용: 43.30%
  • 필수 부작용 누락: 25.36%

전체 실패의 약 **80%**는 추론 오류가 아닌 도구 처리 문제로 귀결되어, 도구 오류 복구, 전제 조건 실패, 빈 조회 처리의 어려움을 드러냈다.

모델 성능 및 신뢰성

벤치마크는 커버리지(최소 한 번 해결 능력)와 일관성(안정적으로 해결 능력) 간의 트레이드오프를 보여준다.

  • 최고의 독점 모델: Claude Opus 5.5가 pass@1 **67.16%**로 1위를 차지했으며, Claude Opus 5(66.50%)와 GPT-5.4(65.36%)가 뒤를 이었다.
  • 최고의 오픈 웨이트 모델: Kimi-K3가 pass@1 **57.37%**로 오픈 웨이트 모델 중 선두를 기록했다.
  • 일관성 대 커버리지: Kimi-K3는 pass@20 **93.89%**로 가장 넓은 커버리지를 보였으나 Observed 20/20은 **13.41%**로 일관성이 낮았다. 반면 Claude Opus 5는 pass@20 **79.09%**로 커버리지는 낮았지만 Observed 20/20 **47.53%**로 일관성이 높았다.
  • 도메인별 편차: 리테일 평균 pass@1은 **59.52%**인 반면, 자동차 보험은 **33.83%**로 도메인별 성능 차이가 두드러졌다.

비용 분석

OpenRouter 목록 가격을 기준으로 단일 성공당 비용과 신뢰할 수 있는 작업(20/20 성공률)당 비용을 분석했다.

  • 단일 성공당 최저 비용: GPT-5.6 Sol ($0.127)
  • 신뢰할 수 있는 성공당 최저 비용: GPT-5.4 ($6.80)
  • Claude Opus 5.5: 단일 성공당 $0.276, 신뢰할 수 있는 작업당 $7.80
  • Kimi-K3: 시도당 비용은 낮았으나 일관성이 낮아 신뢰할 수 있는 작업당 비용이 $20.68로 높게 나타났다.

단일 성공당 비용이 가장 낮은 모델(GPT-5.6 Sol)이 반복적이고 신뢰할 수 있는 운영에는 가장 비용 효율적이지 않다는 점을 데이터가 시사한다.

배포 및 리소스

ThinkingBox는 허깅페이스에서 OpenEnv 인터페이스로 제공된다. 코드는 MIT 라이선스, 벤치마크 데이터는 CDLA-Permissive-2.0, OpenEnv 환경은 BSD-3-Clause 라이선스를 따른다. 본 프로젝트는 마이크로소프트 Copilot Studio 팀이 Toloka, 피츠버그 대학교, 노스웨스턴 대학교, 컬럼비아 대학교, UC 어바인과 협력하여 개발했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.