GPT-5.5, 시각 벤치마크서 10.6% 그쳐
GPT-5.5 Scores 10.6% on ActiveVision, Humans Hit 96.1% [R]
·2026.07.24 04:20
핵심 내용
새 벤치마크 ActiveVision에서 GPT-5.5는 10.6%, Claude Fable 5는 3.5%를 기록한 반면 인간 참가자는 96.1%를 달성했다.
자세히 보기
arXiv 논문이 공개한 새 벤치마크 ActiveVision은 17개 태스크(3개 카테고리)로 구성되며, 모델이 단일 정적 설명이 아닌 반복적 시각 인식을 수행하도록 설계됐다.
주요 결과:
- GPT-5.5 (최고 reasoning-effort 티어): 10.6%, 17개 태스크 중 11개에서 0점
- Claude Fable 5 (대부분의 reasoning·coding 리더보드 1위): 3.5%
- 인간 참가자 3명 평균: 96.1%
단순한 벤치마크 실패보다 주목할 점은 실패의 구조적 특성으로, 모델이 자체 코드 작성으로도 이 한계를 보완하지 못한다는 것이다. 프론티어 비전 모델의 반복적·능동적 시각 처리 능력에 근본적 한계가 있음을 시사한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.