LiveCodeBench 리더보드 공개
Introducing the LiveCodeBench Leaderboard - Holistic and Contamination-Free Evaluation of Code LLMs
·2024.04.16 09:00
데이터 오염 문제를 해결하고 코드 생성 능력을 다각도로 평가하는 LiveCodeBench 리더보드가 출시되었다.
UC Berkeley, MIT, Cornell 연구진이 개발한 LiveCodeBench가 공개되었다. 이 벤치마크는 LeetCode, AtCoder, CodeForces 등 코딩 플랫폼의 문제를 활용하여 LLM의 코드 생성 능력을 측정한다.
기존 벤치마크의 주요 문제점인 **데이터 오염(Contamination)**을 방지하기 위해, 문제의 출시 날짜를 기록하여 모델의 학습 데이터 컷오프 이후에 공개된 문제로 성능을 검증하는 '시간 흐름에 따른 평가(scrolling over time)' 방식을 도입했다.
평가는 다음 네 가지 시나리오를 통해 다각도로 이루어진다:
- Code Generation: 문제 설명을 바탕으로 올바른 코드 생성
- Self Repair: 오류 피드백을 통한 코드 수정 능력 평가
- Code Execution: 코드와 입력값에 대한 실행 결과 예측
- Test Output Prediction: 문제 설명과 입력값만으로 예상 출력값 생성
성능 테스트 결과, GPT-4-Turbo가 대부분의 시나리오에서 가장 뛰어난 성능을 보였으며, Claude-3-Opus는 테스트 출력 예측에서, Mistral-Large는 자연어 추론 기반 작업에서 강점을 보였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.