AI Briefing

아랍어 벤치 정화

QIMMA قِمّة ⛰: A Quality-First Arabic LLM Leaderboard

·2026.04.21 19:09

핵심 내용

QIMMA는 아랍어 벤치마크를 먼저 검증한 뒤 LLM을 평가한다.

1 / 2

자세히 보기

QIMMA(قِمّة)는 평가 전에 벤치마크 품질을 검증해 아랍어 LLM 점수를 다시 매긴 리더보드다.

  • 109개 서브셋, 14개 원천 벤치마크, 총 5만2천여 샘플을 통합했다.
  • 문화, STEM, 법률, 의료, 안전, 문학, 코딩 등 7개 도메인을 다룬다.
  • 전체의 99%가 네이티브 아랍어이며, 아랍어 리더보드로는 처음으로 코드 평가를 포함한다.

품질 검증은 2단계 파이프라인으로 진행된다.

  • Stage 1: Qwen3-235B-A22B-Instruct와 DeepSeek-V3-671B가 각각 샘플을 10점 루브릭으로 평가한다.
  • 두 모델 중 하나라도 7/10 미만이면 Stage 2로 넘어간다.
  • Stage 2: 원어민 아랍어 화자가 문화적 맥락, 방언 뉘앙스, 주관적 해석, 미세한 오류를 최종 검토한다.

검증 결과, 기존 벤치마크에서 반복적인 품질 문제가 드러났다.

  • ArabicMMLU: 14,163개 중 436개 폐기, 3.1%
  • MizanQA: 1,769개 중 41개 폐기, 2.3%
  • PalmX: 3,001개 중 25개 폐기, 0.8%
  • MedAraBench: 4,960개 중 33개 폐기, 0.7%
  • FannOrFlop: 6,984개 중 43개 폐기, 0.6%

문제 유형은 정답 품질 오류, 텍스트·포맷 훼손, 문화적 편향, 골드 정답과 프로토콜 불일치로 정리된다.

코드 벤치마크인 **3LM HumanEval+**와 **3LM MBPP+**는 샘플을 버리지 않고 아랍어 문제 서술만 다듬었다.

  • HumanEval+ 프롬프트 88% 수정
  • MBPP+ 프롬프트 81% 수정

평가는 LightEval, EvalPlus, FannOrFlop으로 재현 가능하게 구성했고, MCQ·QA·코드 유형별로 서로 다른 지표를 적용했다. 결과는 2026년 4월 기준 공개되어 있으며, 상위 모델 중 Qwen/Qwen3.5-397B-A17B-FP8가 평균 68.06으로 1위를 기록했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.