AI Briefing

LLM 환각 측정 리더보드 공개

The Hallucinations Leaderboard, an Open Effort to Measure Hallucinations in Large Language Models

·2024.01.29 09:00

핵심 내용

LLM의 사실성 및 충실성 환각을 평가하기 위한 오픈 소스 리더보드가 공개되었다.

자세히 보기

LLM의 고질적인 문제인 환각(Hallucination) 현상을 체계적으로 측정하기 위한 Hallucinations Leaderboard가 공개되었다. 이 프로젝트는 다양한 오픈 소스 모델들의 신뢰성을 평가하는 것을 목표로 한다.

환각 현상은 다음과 같이 두 가지로 분류하여 평가한다:

  • 사실성 환각(Factuality Hallucinations): 생성된 내용이 실제 사실과 모순되는 경우.
  • 충실성 환각(Faithfulness Hallucinations): 생성된 내용이 사용자의 지시나 주어진 문맥과 일치하지 않는 경우.

리더보드는 EleutherAI의 LM Evaluation Harness를 기반으로 제로샷 및 퓨샷 인컨텍스트 학습을 통해 모델을 평가한다. 관련 연구 내용은 arXiv에 게재된 논문을 통해 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.