AI Briefing

HuggingFace, 아랍어 LLM 리더보드 공개

Introducing the Open Arabic LLM Leaderboard

·2024.05.14 09:00

핵심 내용

아랍어 LLM의 성능을 전문적으로 평가하기 위한 Open Arabic LLM Leaderboard가 공개되었다.

자세히 보기

**Open Arabic LLM Leaderboard (OALL)**는 아랍어 자연어 처리(NLP) 분야의 연구 및 개발을 촉진하기 위해 설계된 전문 벤치마크 플랫폼이다.

주요 벤치마크 데이터셋은 다음과 같다:

  • AlGhafa: 독해, 감성 분석, 질의응답 등을 평가하는 22개의 데이터셋 포함.
  • ACVA 및 AceGPT: 58개의 데이터셋과 MMLU, EXAMS의 아랍어 번역 버전을 활용하여 언어적 복잡성을 반영.

기술적 구성은 lighteval 라이브러리를 사용하여 평가를 수행하며, 백엔드는 TII 클러스터에서 구동된다. 평가 지표로는 모델 성능을 공정하게 측정할 수 있는 normalized log likelihood accuracy를 사용한다.

향후 계획으로는 RAG(검색 증강 생성) 시나리오용 리더보드, ELO 점수 기반의 챗봇 아레나, 그리고 50여 개의 데이터셋을 포함하는 OpenDolphin 벤치마크 개발이 예정되어 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.