AI Briefing

코드 생성 벤치마크 BigCodeBench 공개

BigCodeBench: The Next Generation of HumanEval

·2024.06.18 09:00

핵심 내용

실무적인 프로그래밍 능력 평가를 위한 새로운 LLM 코드 생성 벤치마크 BigCodeBench가 공개되었다.

1 / 2

자세히 보기

기존 HumanEval은 알고리즘 중심의 단순한 태스크로 구성되어 실제 소프트웨어 개발 환경을 반영하지 못하며, 데이터 오염 및 과적합 문제로 인해 LLM의 일반화 능력을 평가하는 데 한계가 있다.

이를 해결하기 위해 공개된 BigCodeBench는 LLM의 실무적인 프로그래밍 역량을 정밀하게 평가하는 데 중점을 둔다.

주요 특징:

  • 방대한 태스크 규모: 139개의 라이브러리를 활용한 1,140개의 함수 수준 태스크를 포함한다.
  • 실무 중심 설계: 단계별 가이드 없이 사용자 관점의 복잡한 명령어를 제공하며, 다양한 함수를 조합하여 문제를 해결하는 능력을 요구한다.
  • 엄격한 검증: 평균 **99%**의 브랜치 커버리지를 가진 테스트 케이스를 통해 프로그램의 동작을 철저히 검증한다.
  • 신뢰도 높은 평가: LLM이 긴 코드를 생략하는 경향을 보완하기 위해 calibrated Pass@1 방식을 도입하여 성능을 측정한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.