AI 벤치마크 격차 162개 중 명확히 구분되는 것은 20개뿐
I checked 162 benchmark gaps from the latest Claude, GPT, Gemini and Mistral launches + 9 leaderboards. Only 20 separate cleanly.
핵심 내용
AI 벤치마크 격차 162개 중 통계적으로 명확히 구분되는 것은 20개뿐인 것으로 드러났다.
자세히 보기
최근 출시된 Claude, GPT, Gemini, Mistral 모델의 162개 벤치마크 격차와 9개 리더보드를 분석한 결과, 표본 오차를 고려할 때 명확하게 구분되는 격차는 20개에 불과했다. 이는 AI 모델 성능 비교 방식의 심각한 문제를 지적하며, 널리 인용되는 많은 '우위'가 통계적으로 구별되지 않거나 검증 불가능함을 시사한다.
출시 차트 신뢰성
6개 프런티어 모델 출시 게시물에서 인용된 44개 격차를 조사한 결과는 다음과 같다.
- 11개는 명확하게 구분됨.
- 5개는 구분되지 않음.
- 28개는 공개된 데이터로 검증 불가 (반복 횟수 미기재 평균값, 하네스 불일치, 불명확한 설정 등).
특히 Gemini 4 Argon은 15개 비교에서 공개 수치가 정직한 구간을 뒷받침하지 못했고, Mistral Large 4는 9개였다. 이 24개 비교는 공개 데이터로 정직하게 검증할 수 없었다.
리더보드 노이즈
9개 리더보드 뷰의 118개 인접 쌍을 분석한 결과, 9개만 구분됐다. SWE-bench Multilingual의 경우 상위 두 점수(72.7% vs 66.3%)가 결정적으로 보이지만, 과제가 300개뿐이라 통계적 해상도가 낮다. 해당 쌍의 신뢰 구간은 0을 포함하므로 통계적으로 유의미하지 않다. 실제로 해당 리더보드에서 6개 순위는 1위와 구별할 수 없다.
방법론 및 투명성
저자는 초기에 21개 격차를 구분된 것으로 식별했으나, 벤치마크 점수 유형과 공개된 불확실성 지표에 대한 엄격한 감사를 거쳐 20개로 수정했다. Claude Code로 구축된 분석 파이프라인은 공개되어 재현 가능하다. 데이터, 보고서, 벤치마크 격차 테스트용 인터랙티브 계산기는 driftproofhq.com에서 확인할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.