Hugging Face, 분산형 평가 시스템 출시
Community Evals: Because we're done trusting black-box leaderboards over the community
·2026.02.04 09:00
Hugging Face가 모델 평가의 투명성을 높이기 위해 커뮤니티가 직접 점수를 제출하고 검증할 수 있는 분산형 평가 시스템을 출시했다.
현재 LLM 벤치마크는 점수 포화 상태에 이르렀으며, 보고되는 점수 간의 불일치로 인해 신뢰할 수 있는 단일 출처가 부족한 상황이다. 이를 해결하기 위해 Hugging Face는 분산형 및 투명한 평가 보고 시스템을 도입한다.
주요 기능:
- 벤치마크 데이터셋: 데이터셋 저장소가 리더보드를 직접 호스팅할 수 있다.
eval.yaml을 통해 평가 규격을 정의하며, 허브 전체의 결과를 자동으로 집계하여 표시한다. - 모델 저장소: 모델의 평가 점수는
.eval_results/*.yaml파일로 저장되어 모델 카드에 표시된다. 모델 제작자의 결과뿐만 아니라 커뮤니티의 **Pull Request(PR)**를 통한 결과도 함께 집계된다. - 커뮤니티 참여: 누구나 PR을 통해 모델 평가 결과를 제출할 수 있다. 제출된 결과는 'community'로 표시되며, 논문이나 로그 등 근거 자료를 링크하여 투명성을 확보한다.
이번 업데이트는 평가 과정을 공개하여 재현 가능성을 높이고, API를 통해 누구나 커뮤니티 기반의 리더보드나 대시보드를 구축할 수 있도록 돕는 것을 목표로 한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.