AI Briefing

Upstage, Open Ko-LLM Leaderboard 공개

Introducing the Open Ko-LLM Leaderboard: Leading the Korean LLM Evaluation Ecosystem

·2024.02.20 09:00

Upstage가 한국어 LLM의 성능을 공정하게 평가하기 위한 Open Ko-LLM Leaderboard를 출시했다.

Upstage가 한국어 LLM의 성능을 체계적으로 평가하고 투명한 연구 환경을 조성하기 위해 Open Ko-LLM Leaderboard를 공개했다.

이 리더보드는 데이터 오염(contamination) 문제를 해결하기 위해 기존의 공개 벤치마크와 달리 **비공개 테스트 세트(private test set)**를 구축하여 평가의 공정성을 높인 것이 특징이다.

평가는 한국어의 특수성과 문화를 반영한 5가지 핵심 태스크를 통해 이루어진다:

  • Ko-ARC: 과학적 추론 및 문제 해결 능력
  • Ko-HellaSwag: 상황 이해 및 예측 능력
  • Ko-MMLU: 다양한 분야의 언어 이해 및 지식 수준
  • Ko-Truthful QA: 사실 관계의 정확성 및 진실성
  • Ko-CommonGEN V2: 한국어 상식 및 문화적 맥락 이해

현재까지 1,000개 이상의 모델이 참여하며 한국어 LLM의 성능을 가늠하는 핵심 지표로 자리 잡고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.