Judge Arena: LLM 평가 모델 벤치마킹
Judge Arena: Benchmarking LLMs as Evaluators
·2024.11.19 09:00
LLM의 평가 능력을 비교하고 순위를 매기는 벤치마킹 플랫폼 Judge Arena가 출시되었다.
LLM의 답변을 채점하고 근거를 제시하는 LLM-as-a-Judge 모델들의 성능을 비교하는 플랫폼 Judge Arena가 출시되었다.
LMSys의 Chatbot Arena와 유사하게 사용자가 두 모델의 평가 결과(점수 및 비평)를 비교하여 더 적절한 평가자에게 투표하는 크라우드소싱 방식으로 운영된다.
- 포함 모델: GPT-4o, Claude 3.5, Llama 3.1, Qwen 2.5, Gemma 2 등 주요 오픈 및 폐쇄형 모델 18종
- 주요 관찰 결과:
- GPT-4 Turbo가 근소한 차이로 선두를 달리고 있으나, Llama와 Qwen 모델이 폐쇄형 모델들과 대등하게 경쟁 중이다.
- Qwen 2.5 7B 및 Llama 3.1 8B와 같은 소규모 모델이 대형 모델에 필적하는 뛰어난 평가 성능을 보였다.
- Llama 모델이 평가용 베이스 모델로서 강력한 성능을 보인다는 기존 연구 결과와 일치하는 경향을 나타냈다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.