BenchBench 소개
·2026.05.26 09:00
AI 모델의 벤치마크 생성 능력을 측정하는 BenchBench가 공개되었으며, GPT 5.2가 유일한 승자로 선정되었다.
기존 벤치마크들이 모델의 성능 향상으로 인해 빠르게 포화 상태에 이르고 있다. 이에 따라 모델이 얼마나 좋은 벤치마크를 스스로 설계할 수 있는지를 측정하는 BenchBench가 등장했다.
각 모델은 기존 벤치마크 보고서를 검토한 뒤, 프론티어 모델을 압도할 수 있으면서도 실제로 해결 가능한 새로운 벤치마크를 만들어야 한다. 모델이 실패할 경우, 실패 원인을 피드백으로 제공하여 다시 도전하게 하는 반복 과정을 거친다.
테스트 결과, GPT 5.2만이 다른 모델들이 풀기 어려운 유용한 벤치마크를 생성하며 유일한 승자로 기록되었다. 반면 다른 모델들은 다음과 같은 한계를 보였다.
- GPT-5.4: 정책 및 거버넌스 시나리오를 구축했으나, 단순 체크리스트 형태로 변질됨.
- GPT-5.5: 절차적 규칙 과제를 생성했으나, 특정 스키마나 숨겨진 레이블에 과도하게 의존함.
- Gemini 3.1 Pro: 질적으로 차별화된 과제를 생성했으나, 지나치게 퍼즐 같거나 취약함.
- Gemini 3.5 Flash: 상업적 규제 관련 문제는 우수했으나, 난이도가 낮아 상위 모델들이 쉽게 해결함.
- Claude Opus: 우아한 경연 스타일의 문제를 만들었으나, 가독성이 너무 좋아 해결하기 쉬움.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.