AI Briefing

마이크로소프트, 에이전트 신뢰성 벤치마크 ThinkingBox 공개

ThinkingBox: Solving an agent task once vs. solving it 20/20: 507 stateful workflows graded on terminal database state [R]

·2026.10.09 09:50

핵심 내용

마이크로소프트가 공개한 ThinkingBox 벤치마크 결과, 높은 pass@20 점수가 일관된 작업 완성을 보장하지 않는 것으로 나타났다.

자세히 보기

마이크로소프트가 ThinkingBox 벤치마크를 공개했다. 이 벤치마크는 리테일, 여행/호스피탈리티, 자동차 보험, 네오뱅크 내부 IT, 컨설팅 IT/HR 등 5개 도메인의 507개 정책 기반 비즈니스 워크플로우로 구성된다. 에이전트 신뢰성 평가를 위해 각 태스크를 클린 백엔드 상태에서 20회 실행하며, 모델당 총 10,140회의 트라이얼을 수행한다.

신뢰성 관련 주요 발견

에이전트가 태스크를 한 번이라도 해결하는 능력(pass@20)과 일관되게 해결하는 능력(all-20) 사이에 큰 격차가 존재한다.

  • Kimi-K3는 **93.89%**의 태스크를 한 번 이상 해결해 가장 높은 커버리지를 기록했으나, 20회 모두 성공한 비율은 **13.41%**에 그쳤다.
  • Claude Opus 5는 **79.09%**의 태스크를 한 번 이상 해결했으며, 20회 모두 성공한 비율은 **47.53%**로 더 높은 반복성을 보였다.
  • Qwen3.8-27B는 **89.35%**의 태스크를 한 번 이상 해결했으나, 일관된 성공률은 **7.50%**였다.

실패 분석

121,680개의 유효 트라이얼에 대한 사후 분석 결과, 실패한 시도 중 **67.24%**가 도구 오류 없이 정상적으로 종료되어 기존 완료 지표로는 성공으로 잘못 판단될 수 있었다. 이러한 정상 종료 실패 사례에서 상태 체크가 식별한 주요 실패 유형은 다음과 같다(범주 간 중복 있음).

  • 잘못된 필드 값: 77.61%
  • 의도치 않은 추가 효과: 43.30%
  • 필수 효과 누락: 25.36%

이용 가능 여부

벤치마크, 코드, 데이터셋은 GitHub와 Hugging Face에서 공개된다. 개발자는 HF OpenEnv를 통해 507개 태스크에 대해 자체 모델을 평가할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.