AI Briefing

한국어 LLM 성능 평가용 Open Ko-LLM 리더보드 개설

핵심 내용

업스테이지와 NIA가 한국어 LLM 성능 비교용 Open Ko-LLM 리더보드를 연다.

자세히 보기

업스테이지와 NIA가 한국어 LLM 성능을 비교할 수 있는 Open Ko-LLM 리더보드를 9월 27일 개설한다. 허깅페이스의 기존 오픈LLM 리더보드를 단순 번역한 것이 아니라, 한국어의 특성과 문화를 반영한 자체 데이터로 만든 점이 핵심이다.

누구나 자신이 개발한 한국어 LLM을 등록해 다른 모델과 경쟁할 수 있는 공개 플랫폼이며, 연구자들은 개설 이후 허깅페이스의 Open Ko-LLM 리더보드 스페이스에서 참여 방법을 확인할 수 있다.

평가 체계에는 한국어 특화 항목이 추가됐다.

  • 한국어의 특성과 문화를 반영한 고품질 데이터
  • 상식을 생성하는 능력을 보는 상식생성 기준
  • 역사 왜곡, 환각 오류, 형태소 오류, 불규칙 활용 오류, 혐오 표현 등을 포함한 질문지

이 상식생성 데이터셋은 업스테이지가 고려대 임희석 교수 연구진과 협업해 구축했다. 한국어 사용자 관점에서 자연스럽고 상식에 맞는 출력을 내는지 평가하려는 목적이며, 대표적인 할루시네이션 사례로 거론되는 '세종대왕의 맥북던짐 사건' 같은 오류도 줄이는 데 초점을 맞췄다.

업스테이지는 이번 리더보드가 한국어 LLM 연구 경쟁력을 높이고, 한국어 데이터의 양과 질을 개선하며, 공동 연구와 협업을 촉진할 것으로 기대하고 있다. 최근 KT와의 협업으로 확보한 KT Cloud 인프라도 리더보드의 안정적 운영에 활용될 예정이다.

업스테이지의 Solar는 지난 8월 허깅페이스 오픈 LLM 리더보드에서 세계 1위를 기록했고, 최근에는 Poe의 메인 모델에도 등록됐다. 업스테이지는 1T클럽 기반의 한국어 데이터와 이번 리더보드를 통해 한국 AI 생태계 확대와 LLM 독립에 기여하겠다는 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.