AI Briefing

Hugging Face, LLM 평가 체계 확장

Can foundation models label data like humans?

·2023.06.12 09:00

Hugging Face가 LLM의 데이터 라벨링 신뢰성을 검증하기 위해 Open LLM Leaderboard의 평가 방식을 확장했다.

ChatGPT 이후 지시 이행(Instruction-following) 모델의 발전이 가속화되었으나, 정성적인 사용자 선호도를 측정할 객관적 벤치마크는 여전히 부족하다. 최근 많은 모델이 GPT-4 기반 평가를 인간의 선호도를 대신하는 대리 지표로 활용하고 있지만, 이 방식이 실제 인간의 판단과 얼마나 일치하는지는 검증이 필요하다.

Hugging Face는 이러한 문제를 해결하기 위해 Open LLM Leaderboard의 평가 체계를 다음과 같이 확장했다.

  • 자동화된 학술적 벤치마크
  • 전문가 수준의 인간 라벨링
  • GPT-4 기반 평가

이를 통해 LLM이 데이터 라벨링 도구로서 얼마나 신뢰할 수 있는지 조사하고, 모델의 역량을 보다 종합적으로 비교할 수 있는 지표를 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.