GPT-5.5, 시각 벤치마크서 10.6% 그쳐
GPT-5.5 Scores 10.6% on ActiveVision, Humans Hit 96.1% [R]
·2026.07.24 04:20
새 벤치마크 ActiveVision에서 GPT-5.5는 10.6%, Claude Fable 5는 3.5%를 기록한 반면 인간 참가자는 96.1%를 달성했다.
arXiv 논문이 공개한 새 벤치마크 ActiveVision은 17개 태스크(3개 카테고리)로 구성되며, 모델이 단일 정적 설명이 아닌 반복적 시각 인식을 수행하도록 설계됐다.
주요 결과:
- GPT-5.5 (최고 reasoning-effort 티어): 10.6%, 17개 태스크 중 11개에서 0점
- Claude Fable 5 (대부분의 reasoning·coding 리더보드 1위): 3.5%
- 인간 참가자 3명 평균: 96.1%
단순한 벤치마크 실패보다 주목할 점은 실패의 구조적 특성으로, 모델이 자체 코드 작성으로도 이 한계를 보완하지 못한다는 것이다. 프론티어 비전 모델의 반복적·능동적 시각 처리 능력에 근본적 한계가 있음을 시사한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.