Artificial Analysis, Capability Indices v1.1 발표… Claude Fable 5.1 6개 부문 모두 1위, Grok 4.5 비용 효율 주목
핵심 내용
Artificial Analysis가 Capability Indices v1.1을 발표했으며, Claude Fable 5.1이 6개 직업군 인덱스 모두에서 1위를 차지했고 Grok 4.5는 높은 비용 효율성을 입증했다.
자세히 보기
Artificial Analysis가 Capability Indices v1.1과 Intelligence Index v4.2를 발표하며 최신 AI 모델들의 성능과 비용을 재평가했다. Claude Fable 5.1은 Finance & Accounting, Strategy & Ops, Legal, Healthcare & Medical, Engineering, Economics 등 6개 Capability Indices 모두에서 1위를 기록했다. 오픈 웨이트 모델 중에서는 Kimi K3가 Finance & Accounting, Legal, Economics 분야에서, DeepSeek V4.1 Flash가 Strategy & Ops 분야에서, GLM-5.3가 Healthcare & Medical과 Engineering 분야에서 각각 오픈 웨이트 모델 중 1위를 차지했다.
Grok 4.5는 에이전트 작업에서 강력한 성능을 보이며 GDPval-AA v2에서 4위(Elo 1543)를 기록했고, 𝜏³-Banking에서 33%로 GPT-5.5(31%)를 앞섰다. 비용 측면에서는 Intelligence Index 기준 태스크당 $0.31, Coding Agent Index(Grok Build) 기준 $2.49로 Opus 4.8($11.80) 대비 60% 이상 저렴한 헤드라인 가격을 기록하며 비용-성능 파레토 프론티어에 위치했다.
Gemini 3.1 Pro Preview는 Intelligence Index를 구성하는 10개 평가 중 6개(Terminal-Bench Hard, AA-Omniscience 등)에서 1위를 차지했으며, Opus 4.6 및 GPT-5.5 등 선두 모델 대비 절반 미만의 비용으로 실행 가능하다. 다만 GLM-5 등 선두 오픈 웨이트 모델보다는 약 2배 높은 비용을 보인다. 또한 신규로 발표된 Endpoint Accuracy Index는 GLM-5.2, gpt-oss-120b, DeepSeek V4 Pro의 서드파티 호스팅 정확도 보존율을 측정한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.