Hugging Face 벤치마크 리더보드 분석: 중국 모델 강세, 검증은 전무
허깅페이스 공인 벤치마크 리더보드 48개 전수 분석: 데이터 구조, 집계 방법, 그리고 숫자가 말해 주는 것
핵심 내용
공인 리더보드 44개 중 검증된 점수는 0건이며, 중국 조직이 등록의 55.2%를 차지했다.
자세히 보기
2026년 10월 5일 기준 Hugging Face 공개 API 데이터를 분석한 결과, benchmark:official 태그가 붙은 48개 데이터셋 중 리더보드가 존재하는 것은 44개였다. 기본 화면 기준 총 1,023건의 등록이 확인되었으며, 이는 411개 모델과 95개 조직에 의해 제출된 수치다.
경쟁 구도와 지역별 비중
벤치마크별 등록 수의 중앙값은 11.5건으로, 평균(21.3건)보다 낮아 소수 벤치마크에 등록이 집중되는 오른쪽 꼬리 분포를 보였다. 상위 5개 벤치마크(MMLU-Pro, GPQA, HLE 등)가 전체 등록의 **45.9%**를 차지했다. 국가별로는 중국이 565건(55.2%)으로 압도적인 비중을 보였고, 미국(22.6%), 한국(4.1%)이 뒤를 이었다. Qwen, Z.ai, DeepSeek 등 중국 조직들이 참가 규모에서 상위권을 형성했으나, 1위 획득 수는 FINAL-Bench(9회), Moonshot AI(4회), Z.ai(4회) 등으로 분산되었다.
검증 부재와 데이터 해석 주의점
가장 중요한 발견은 모든 점수가 제작사의 자체 보고(Self-reported) 값이라는 점이다. Hugging Face가 별도로 검증한 verified 플래그가 붙은 항목은 0건이었다. 또한 기본 리더보드 화면은 base_model이 선언된 파생 모델을 제외하므로, 이를 포함하면 등록 건수가 약 30%(446건) 더 늘어난다. 에이전트 및 터미널 관련 벤치마크는 17개로 가장 많았지만, 평가 비용 문제로 벤치마크당 등록 수가 11.6건에 그쳐 과학·지식 분야(벤치마크당 58.0건) 대비 경쟁 강도가 낮았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.