AI Briefing

ProgramBench 벤치마크 공개

ProgramBench: Can we really rebuild huge binaries from scratch? (doesn't look like it)

·2026.05.06 00:40

ProgramBench가 실행 파일 기반 200개 복원 태스크를 공개했다.

Facebook Research가 ProgramBench를 공개했다. 실행 파일과 README/usage 파일만으로 원본 프로그램을 다시 구현할 수 있는지 평가하는 벤치마크다.

  • 200개 태스크로 구성됐고, 에이전트는 언어 선택부터 추상화 계층 설계, 전체 아키텍처 구성까지 맡는다.
  • 인터넷 접속 금지, 디컴파일 금지 조건에서 블랙박스 실행 결과만으로 채점한다.
  • 5만 달러를 들여 600만 줄의 behavioral tests를 생성한 뒤, 품질 기준으로 필터링했다.

공식 사이트와 함께 GitHub, Hugging Face, Docker 이미지가 공개됐고, pip install programbench && programbench eval <your submission>으로 바로 평가를 시작할 수 있다.

현재 공개된 결과는 폐쇄형 모델 중심이며, 오픈소스 모델은 SWE-bench 계열 과제에 더 맞춰져 있어 새 벤치마크에서 더 어려움을 겪는다고 설명했다. 제출용 공개도 곧 열 계획이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.