AI Briefing

BigCodeArena: 실행 기반 코드 평가 플랫폼

BigCodeArena: Judging code generations end to end with code executions

·2025.10.07 18:37

핵심 내용

코드 생성 모델의 품질을 실제 실행 결과로 평가하는 인간 참여형 플랫폼 BigCodeArena가 출시되었다.

1 / 2

자세히 보기

기존 HumanEval과 같은 정적 벤치마크의 한계를 극복하기 위해, 생성된 코드를 직접 실행하고 결과를 확인하며 평가할 수 있는 BigCodeArena가 공개되었다.

이 플랫폼은 모델이 생성한 코드를 격리된 샌드박스 환경에서 즉시 실행하여 실제 출력값을 보여준다. Python, JavaScript, C++ 등 10개 언어와 React, Streamlit, PyGame 등 8개 실행 환경을 지원한다.

주요 특징은 다음과 같다:

  • 대화형 테스트: 사용자가 생성된 웹 앱의 UI를 조작하거나 게임을 플레이하며 결과물을 직접 검증할 수 있다.
  • 멀티턴 대화 지원: 단순 코드 생성을 넘어, 요구사항 수정 및 버그 수정을 요청하는 실제 개발 프로세스를 반영한다.
  • 커뮤니티 리더보드: 사용자의 투표를 바탕으로 코드 생성 모델의 성능을 비교하는 리더보드를 운영한다.

출시 이후 5개월간 500명 이상의 사용자가 참여하여 14,000건 이상의 대화와 4,700건 이상의 투표 데이터를 수집하며 모델 성능을 검증하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.