AI Briefing

Artificial Analysis, Capability Indices v1.1 발표… Claude Fable 5.1 6개 부문 모두 1위, Grok 4.5 비용 효율 주목

·2026.09.15 09:00

핵심 내용

Artificial Analysis가 Capability Indices v1.1을 발표했으며, Claude Fable 5.1이 6개 직업군 인덱스 모두에서 1위를 차지했고 Grok 4.5는 높은 비용 효율성을 입증했다.

1 / 9

자세히 보기

Artificial Analysis가 Capability Indices v1.1과 Intelligence Index v4.2를 발표하며 최신 AI 모델들의 성능과 비용을 재평가했다. Claude Fable 5.1은 Finance & Accounting, Strategy & Ops, Legal, Healthcare & Medical, Engineering, Economics 등 6개 Capability Indices 모두에서 1위를 기록했다. 오픈 웨이트 모델 중에서는 Kimi K3가 Finance & Accounting, Legal, Economics 분야에서, DeepSeek V4.1 Flash가 Strategy & Ops 분야에서, GLM-5.3가 Healthcare & Medical과 Engineering 분야에서 각각 오픈 웨이트 모델 중 1위를 차지했다.

Grok 4.5는 에이전트 작업에서 강력한 성능을 보이며 GDPval-AA v2에서 4위(Elo 1543)를 기록했고, 𝜏³-Banking에서 33%로 GPT-5.5(31%)를 앞섰다. 비용 측면에서는 Intelligence Index 기준 태스크당 $0.31, Coding Agent Index(Grok Build) 기준 $2.49로 Opus 4.8($11.80) 대비 60% 이상 저렴한 헤드라인 가격을 기록하며 비용-성능 파레토 프론티어에 위치했다.

Gemini 3.1 Pro Preview는 Intelligence Index를 구성하는 10개 평가 중 6개(Terminal-Bench Hard, AA-Omniscience 등)에서 1위를 차지했으며, Opus 4.6 및 GPT-5.5 등 선두 모델 대비 절반 미만의 비용으로 실행 가능하다. 다만 GLM-5 등 선두 오픈 웨이트 모델보다는 약 2배 높은 비용을 보인다. 또한 신규로 발표된 Endpoint Accuracy Index는 GLM-5.2, gpt-oss-120b, DeepSeek V4 Pro의 서드파티 호스팅 정확도 보존율을 측정한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.