AI Briefing

HuggingFace, 아랍어 LLM 리더보드 공개

Introducing the Open Arabic LLM Leaderboard

·2024.05.14 09:00

아랍어 LLM의 성능을 전문적으로 평가하기 위한 Open Arabic LLM Leaderboard가 공개되었다.

**Open Arabic LLM Leaderboard (OALL)**는 아랍어 자연어 처리(NLP) 분야의 연구 및 개발을 촉진하기 위해 설계된 전문 벤치마크 플랫폼이다.

주요 벤치마크 데이터셋은 다음과 같다:

  • AlGhafa: 독해, 감성 분석, 질의응답 등을 평가하는 22개의 데이터셋 포함.
  • ACVA 및 AceGPT: 58개의 데이터셋과 MMLU, EXAMS의 아랍어 번역 버전을 활용하여 언어적 복잡성을 반영.

기술적 구성lighteval 라이브러리를 사용하여 평가를 수행하며, 백엔드는 TII 클러스터에서 구동된다. 평가 지표로는 모델 성능을 공정하게 측정할 수 있는 normalized log likelihood accuracy를 사용한다.

향후 계획으로는 RAG(검색 증강 생성) 시나리오용 리더보드, ELO 점수 기반의 챗봇 아레나, 그리고 50여 개의 데이터셋을 포함하는 OpenDolphin 벤치마크 개발이 예정되어 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.