AI Briefing

Scale AI, 직관적 시각 추론 벤치마크 HSS 공개… 인간 93.1% vs GPT-6-astra 53.6%

·2026.10.08 09:00

핵심 내용

Scale AI가 공개한 HSS 벤치마크에서 인간은 93.1%의 정확도를 기록한 반면 최고 모델 GPT-6-astra는 53.6%에 그쳤다.

1 / 2

자세히 보기

Scale AI 연구진이 멀티모달 대형 언어 모델(MLLM)의 직관적 시각 추론 능력을 평가하기 위한 새로운 벤치마크 **Humanity’s Sixth Sense (HSS)**를 공개했다. 기존 벤치마크는 전문가 수준의 분석이나 저수준 지각에 초점을 맞춰, 인간이 단번에 수행하는 암시적 시간, 공간, 사회적, 추상적 추론은 거의 검증되지 않았다.

HSS 벤치마크는 다양한 이미지와 영상 입력을 구조화된 분류 체계로 구성했다. 각 항목은 사람이 작성한 프롬프트와 연결되어, 주차된 차 사이에 차량이 들어갈 수 있는지 판단하거나 방 안의 권위자를 식별하는 등 단번의 시선이나 짧은 영상에서 유추하는 암시적 구조를 탐구한다.

인간과 모델 간 성능 격차

최신 MLLM은 직관적 시각 작업에서 인간 참가자 대비 현저히 낮은 성능을 보였다:

  • 인간 성능: 참가자 정확도 93.1%
  • 모델 성능: 최고 성능 모델인 GPT-6-astra는 최대 추론 노력에서도 정확도 **53.6%**에 그쳤다.

고도화된 지각과 지식이 필요한 복잡한 작업에서는 뛰어난 성능을 보이지만, 현행 모델들은 이러한 직관적 시각 추론 능력에서는 어려움을 겪고 있다. 연구진은 동적 시각 조작을 적용한 에이전트 설정을 실험했으나 성능 격차는 좁혀졌을 뿐 완전히 해소되지 않았다.

HSS는 직관적 시각 추론을 측정 가능한 축으로 확립하며, 기존 벤치마크 확장 과정에서 간과된 능력을 부각한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.