PaperBench: AI 연구 재현 능력을 평가하는 벤치마크
·2025.04.02 19:15
OpenAI가 AI 에이전트의 최신 AI 연구 재현 능력을 평가하는 벤치마크인 PaperBench를 공개했다.
PaperBench는 AI 에이전트가 최신 AI 연구를 얼마나 잘 재현할 수 있는지 평가하는 벤치마크다. 에이전트는 ICML 2024의 Spotlight 및 Oral 논문 20편을 대상으로 논문 기여도 이해, 코드베이스 개발, 실험 실행을 처음부터 끝까지 수행해야 한다.
평가의 정확성을 위해 각 논문의 저자와 협력하여 개발한 루브릭(rubric)을 사용하며, 총 8,316개의 세부 평가 항목으로 구성된다. 또한, 대규모 평가를 가능하게 하기 위해 루브릭을 바탕으로 재현 시도를 자동 채점하는 LLM 기반 판사(judge) 모델도 함께 개발되었다.
주요 평가 결과는 다음과 같다:
- 가장 높은 성능을 보인 Claude 3.5 Sonnet (New)(오픈 소스 스캐폴딩 활용 시)의 평균 재현 점수는 **21.0%**였다.
- 최상위권 ML 박사급 인력을 대상으로 한 테스트 결과, 현재의 AI 모델은 아직 인간 수준의 성능에 도달하지 못했다.
OpenAI는 AI 에이전트의 엔지니어링 역량을 이해하기 위한 향후 연구를 지원하고자 관련 코드를 오픈 소스로 공개했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.