APEX-Accounting: 회계 업무를 위한 AI 생산성 벤치마크
APEX-Accounting은 회계 업무에서 AI가 반복적으로 정확한 결과를 내는지 평가했다.
APEX-Accounting은 Ramp와 Mercor가 공동 개발한 회계 AI 에이전트 벤치마크다. 회계 전문가가 작성한 160개 과제를 10개 가상 기업 환경에서 평가하며, 파일 간 불일치 조정과 기업별 맥락 적용, 다단계 판단, 결과의 일관성을 측정한다.
각 모델은 모든 과제를 8회씩 수행했다. 한 번의 정답보다 반복적인 성공을 중시한 결과, 가장 일관된 모델도 8회 모두 성공한 과제가 전체의 **2.6%**에 불과했다. 모델이 일부 점수를 얻은 과제는 95%를 넘었지만, 어떤 모델도 한 번도 완전히 해결하지 못한 과제도 58%에 달했다.
평균 통과 기준으로는 Claude Fable 5가 56.4%로 1위였고, Meta의 Muse Spark 1.1이 52.6%, GPT-5.6 Sol이 51.5%로 뒤를 이었다. 8회 중 한 번이라도 성공하는 Pass@8에서는 Muse Spark 1.1이 21.5%로 Fable 5의 20.1%를 앞섰다.
비용 예산은 과제당 1달러, 5달러, 10달러, 50달러로 설정했다. Fable 5는 1달러 예산에서 11.8%였지만 50달러에서 55.2%로 크게 향상된 반면, Muse Spark 1.1은 낮은 예산에서도 높은 성능을 보여 추가 비용에 따른 개선 폭이 작았다. 50달러 한도에서 Fable 5는 실행당 약 32달러를 사용했지만 Muse Spark 1.1은 약 5달러만 사용해, 두 모델의 점수 차이는 4%포인트 이내였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.