아랍어 벤치 정화
QIMMA قِمّة ⛰: A Quality-First Arabic LLM Leaderboard
·2026.04.21 19:09
핵심 내용
QIMMA는 아랍어 벤치마크를 먼저 검증한 뒤 LLM을 평가한다.
1 / 2
자세히 보기
QIMMA(قِمّة)는 평가 전에 벤치마크 품질을 검증해 아랍어 LLM 점수를 다시 매긴 리더보드다.
- 109개 서브셋, 14개 원천 벤치마크, 총 5만2천여 샘플을 통합했다.
- 문화, STEM, 법률, 의료, 안전, 문학, 코딩 등 7개 도메인을 다룬다.
- 전체의 99%가 네이티브 아랍어이며, 아랍어 리더보드로는 처음으로 코드 평가를 포함한다.
품질 검증은 2단계 파이프라인으로 진행된다.
- Stage 1: Qwen3-235B-A22B-Instruct와 DeepSeek-V3-671B가 각각 샘플을 10점 루브릭으로 평가한다.
- 두 모델 중 하나라도 7/10 미만이면 Stage 2로 넘어간다.
- Stage 2: 원어민 아랍어 화자가 문화적 맥락, 방언 뉘앙스, 주관적 해석, 미세한 오류를 최종 검토한다.
검증 결과, 기존 벤치마크에서 반복적인 품질 문제가 드러났다.
- ArabicMMLU: 14,163개 중 436개 폐기, 3.1%
- MizanQA: 1,769개 중 41개 폐기, 2.3%
- PalmX: 3,001개 중 25개 폐기, 0.8%
- MedAraBench: 4,960개 중 33개 폐기, 0.7%
- FannOrFlop: 6,984개 중 43개 폐기, 0.6%
문제 유형은 정답 품질 오류, 텍스트·포맷 훼손, 문화적 편향, 골드 정답과 프로토콜 불일치로 정리된다.
코드 벤치마크인 **3LM HumanEval+**와 **3LM MBPP+**는 샘플을 버리지 않고 아랍어 문제 서술만 다듬었다.
- HumanEval+ 프롬프트 88% 수정
- MBPP+ 프롬프트 81% 수정
평가는 LightEval, EvalPlus, FannOrFlop으로 재현 가능하게 구성했고, MCQ·QA·코드 유형별로 서로 다른 지표를 적용했다. 결과는 2026년 4월 기준 공개되어 있으며, 상위 모델 중 Qwen/Qwen3.5-397B-A17B-FP8가 평균 68.06으로 1위를 기록했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.