Hugging Face 리더보드 구축 가이드 공개
A guide to setting up your own Hugging Face leaderboard: an end-to-end example with Vectara's hallucination leaderboard
·2024.01.12 09:00
Hugging Face의 새로운 템플릿을 활용해 맞춤형 LLM 리더보드를 구축하는 기술적 방법과 Vectara의 사례를 소개한다.
Hugging Face는 기존 Open LLM 리더보드보다 가볍고 사용하기 쉬운 **리더보드 템플릿(Leaderboard Templates)**을 출시했다.
Vectara는 이 템플릿을 사용하여 자사의 Hughes Hallucination Evaluation Model (HHEM) 리더보드를 구축한 사례를 공유했다. HHEM은 GPT-4, Gemini, Llama 2 등 다양한 모델이 생성한 요약문에서 발생하는 환각(Hallucination) 빈도를 측정하는 데 특화되어 있다.
리더보드 구축을 위한 주요 기술적 단계는 다음과 같다:
- 데이터셋 관리: 사용자 요청을 기록하는
requests데이터셋과 평가 결과를 저장하는results데이터셋을 생성하여 동적인 업데이트를 지원한다. - 백엔드 커스텀: 복잡한 평가 로직을 구현하기 위해
model_operations.py를 수정하여 요약 생성 및 사실 일관성(Factual Consistency), 환각률(Hallucination Rate) 등을 계산하는 기능을 통합한다.
이 가이드는 개발자들이 자신만의 모델 평가 프레임워크를 구축하고 관리할 수 있는 오픈소스 기반의 실질적인 방법론을 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.