LLM 환각 측정 리더보드 공개
The Hallucinations Leaderboard, an Open Effort to Measure Hallucinations in Large Language Models
·2024.01.29 09:00
핵심 내용
LLM의 사실성 및 충실성 환각을 평가하기 위한 오픈 소스 리더보드가 공개되었다.
자세히 보기
LLM의 고질적인 문제인 환각(Hallucination) 현상을 체계적으로 측정하기 위한 Hallucinations Leaderboard가 공개되었다. 이 프로젝트는 다양한 오픈 소스 모델들의 신뢰성을 평가하는 것을 목표로 한다.
환각 현상은 다음과 같이 두 가지로 분류하여 평가한다:
- 사실성 환각(Factuality Hallucinations): 생성된 내용이 실제 사실과 모순되는 경우.
- 충실성 환각(Faithfulness Hallucinations): 생성된 내용이 사용자의 지시나 주어진 문맥과 일치하지 않는 경우.
리더보드는 EleutherAI의 LM Evaluation Harness를 기반으로 제로샷 및 퓨샷 인컨텍스트 학습을 통해 모델을 평가한다. 관련 연구 내용은 arXiv에 게재된 논문을 통해 확인할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.