AI Briefing

ThinkingBox, 에이전트 신뢰성 벤치마크 공개

ThinkingBox: 에이전트가 남긴 DB 상태로 채점하고 20번 반복해 신뢰성을 재는 업무 에이전트 벤치마크

·2026.10.07 08:00

핵심 내용

507개 업무 과제에서 20회 반복 실행해 최종 DB 상태로 채점하는 신규 벤치마크 공개

1 / 3

자세히 보기

Microsoft, 피츠버그대, 노스웨스턴대 연구팀이 ThinkingBox 벤치마크를 공개했습니다. 기존 벤치마크가 도구 호출 형식이나 대화 내용만 확인하던 것과 달리, ThinkingBox는 대화 종료 후의 최종 DB 상태와 부수 효과를 기준으로 채점합니다.

핵심 발견: One Success Isn't Reliability

가장 중요한 발견은 한 번의 성공(pass@k)과 매번의 성공(pass^k) 사이에 큰 격차가 존재한다는 점입니다. 이를 discovery-reliability gap이라고 명명했습니다.

  • Kimi-K3: 20회 중 1회 이상 성공하는 pass@20은 **93.89%**로 최고였으나, 20회 모두 성공하는 pass^20은 **17.60%**에 그쳤습니다.
  • Claude Opus 5: pass@20은 79.09%로 Kimi-K3보다 낮았지만, pass^20은 **47.53%**로 전체 1위를 기록하며 높은 신뢰성을 보였습니다.
  • GPT-6 Astra: pass@1은 58.31%로 중간 수준이었으나, pass^20은 **46.89%**로 2위를 차지하며 일관된 성능을 입증했습니다.

평가 방식 및 구조

ThinkingBox-Bench는 소매, 여행/숙박, 자동차 보험, 네오뱅크 IT 지원, 컨설팅 IT/HR 지원 등 5개 업무 도메인의 507개 과제를 포함합니다.

  • 채점 기준: 정답 행동 순서를 고정하지 않으며, 모든 검사를 통과해야 1점을 부여합니다. 부분 점수는 없습니다.
  • 반복 실행: 모든 과제를 20회 독립 실행하여 pass@1(평균 성공률), pass@k, pass^k 지표를 산출합니다.
  • 실패 분석: 실패 시도의 **67.24%**는 대화가 정상 종료되고 도구 호출 오류가 없었음에도 최종 상태가 불일치한 경우였습니다. 응답만 보면 성공으로 오판할 수 있는 사례가 많습니다.

모델 성능 및 비용 분석

18개 모델을 평가한 결과, 오픈 웨이트 모델은 파라미터 수와 성능이 비례하지 않는 것으로 나타났습니다. Qwen3.8-27B가 DeepSeek-V4-Pro(1.6T)보다 높은 성능을 보였습니다.

  • 성공 1회당 비용: GPT-5.6-sol이 $0.127로 최저.
  • 20회 모두 성공한 과제 1개당 비용: GPT-5.4가 $6.80로 최저.
  • 강화 학습 미세조정(GRPO): Qwen3.8-27B에 GRPO를 적용해 pass@1을 51.70%에서 **60.78%**로 향상시켰습니다.

한계 및 운영 권고

최종 응답의 소통 품질은 채점하지 않으며, 시뮬레이션 사용자는 협조적이고 목표 변경이 없는 고정된 패턴을 따릅니다. 연구팀은 실제 운영 시 최종 상태 확인, 복구 가능 오류만 재시도, 되돌리기 어려운 변경 시 인간 승인을 권장했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.