AI Briefing

Artificial Analysis, Intelligence Index v4.3 공개

Artificial Analysis Intelligence Index v4.3

·2026.09.08 03:44

핵심 내용

Artificial Analysis가 Terminal-Bench 4.0과 AutomationBench-AA를 도입한 Intelligence Index v4.3을 공개했다.

자세히 보기

Artificial Analysis가 에이전트 코딩 난이도를 높이고 워크플로우 유형을 확장한 Intelligence Index v4.3을 공개했다. 이번 업데이트는 v5로 넘어가기 전 단계로, 실제 문제 해결 능력을 더 잘 반영하고 평가 조작을 방지하기 위해 비공개 테스트셋 비중을 높이는 데 초점을 맞췄다.

주요 변경 사항

  • Terminal-Bench 2.1 → 4.0 업그레이드: 소프트웨어 엔지니어링, 머신러닝, 과학, 운영 등 터미널 기반 다단계 작업 66개를 포함한다. 연산량 및 시간 허용치를 재조정하고, 검증 방식을 개선했다. 하네스는 Terminus 2에서 모델에 종속되지 않는 mini-SWE-agent로 변경되었다.
  • AutomationBench-AA 도입: 기존 𝜏³-Banking을 대체하여 Zapier의 비즈니스 워크플로우 자동화 벤치마크를 적용했다. Gmail, Slack, Salesforce 등 시뮬레이션된 애플리케이션에서 657개의 비즈니스 워크플로우를 테스트한다.

평가 가중치 조정

비공개 테스트셋이나 정답을 사용하는 평가의 비중이 40%에서 45%로 증가했다. 이는 벤치마크 점수 조작(gaming)을 방지하기 위한 조치다. 카테고리별 가중치는 v4.2와 동일하게 유지된다:

  • Agents: 30%
  • Coding: 20%
  • General: 30%
  • Scientific Reasoning: 20%

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.