Fig 분석, 프런티어 모델의 에이전트 작업 성능 불균등 확인
·2026.09.30 09:00
핵심 내용
Fig 분석 결과 프런티어 모델은 에이전트 작업에서 불균등한 성능을 보이며 일관된 우위 모델이 없다.
1 / 4
자세히 보기
Fig이 웹 자동화(VisualWebArena)와 물리적 도메인(Bench2Drive, Assembly101, IndEgo, VLABench)에서 프런티어 모델을 평가했습니다.
- 웹 작업: Fable 5, GPT-5.6, Opus 4.7, Opus 5, Opus 5.5, Kimi K3, GPT-6 Astra 등 7개 모델을 테스트했습니다.
- 물리적 작업: Gemini 3.5-Flash, GPT-6 Astra, Opus 5.5 등 3개 모델을 평가했습니다.
연구 결과 명확한 성능 우위 모델은 없었습니다. 모든 모델 쌍에서 점수가 낮은 모델이 높은 모델이 실패한 작업을 해결했습니다. 웹사이트별 성능 편차도 컸는데, Astra는 Reddit에서, Fable 5는 Classifieds에서 가장 높은 점수를 기록했습니다. 벤치마크 난이도 라벨과 모델 성공률 간 상관관계는 약했습니다. 모델 업데이트는 평균 점수를 크게 바꾸지 않으면서도 성능 프로파일을 재편했습니다. 예를 들어 Opus 5에서 Opus 5.5로 업데이트하면 평균 점수는 5.1%p 상승했지만, Opus 5가 해결했던 11개 작업에서는 실패했습니다. 연구진은 항목별 결과 데이터셋인 RIDGE를 공개했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.