HuggingFace, 아랍어 LLM 리더보드 공개
Introducing the Open Arabic LLM Leaderboard
·2024.05.14 09:00
핵심 내용
아랍어 LLM의 성능을 전문적으로 평가하기 위한 Open Arabic LLM Leaderboard가 공개되었다.
자세히 보기
**Open Arabic LLM Leaderboard (OALL)**는 아랍어 자연어 처리(NLP) 분야의 연구 및 개발을 촉진하기 위해 설계된 전문 벤치마크 플랫폼이다.
주요 벤치마크 데이터셋은 다음과 같다:
- AlGhafa: 독해, 감성 분석, 질의응답 등을 평가하는 22개의 데이터셋 포함.
- ACVA 및 AceGPT: 58개의 데이터셋과 MMLU, EXAMS의 아랍어 번역 버전을 활용하여 언어적 복잡성을 반영.
기술적 구성은 lighteval 라이브러리를 사용하여 평가를 수행하며, 백엔드는 TII 클러스터에서 구동된다. 평가 지표로는 모델 성능을 공정하게 측정할 수 있는 normalized log likelihood accuracy를 사용한다.
향후 계획으로는 RAG(검색 증강 생성) 시나리오용 리더보드, ELO 점수 기반의 챗봇 아레나, 그리고 50여 개의 데이터셋을 포함하는 OpenDolphin 벤치마크 개발이 예정되어 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.