AI Briefing

ProgramBench (5분 읽기)

·2026.05.07 09:00

ProgramBench는 바이너리와 문서만으로 프로그램을 재구현하게 하는 벤치마크다.

ProgramBench는 실행 파일과 문서만 주고 원본 프로그램을 다시 구현하게 하는 벤치마크다. 에이전트는 소스코드를 볼 수 없고, 인터넷도 못 쓰며, objdump·strings·hexdump 같은 디컴파일/분석 도구도 차단된다. 결국 언어 선택, 아키텍처 설계, 전체 코드 작성, 빌드 스크립트 작성까지 모두 스스로 해야 한다.

에이전트 제약은 다음과 같다.

  • 소스코드 접근 불가
  • 인터넷 사용 불가
  • 디컴파일 도구와 바이너리 분석 도구 차단
  • 언어, 구조, 빌드 방식까지 전부 자율 결정

평가 범위는 200개 태스크248,000개 이상의 숨은 동작 테스트다. jq, ripgrep 같은 작은 터미널 유틸리티부터 PHP, FFmpeg, SQLite 같은 대형 프로젝트까지 포함되며, 점수는 모든 테스트를 통과한 resolved와 95% 이상을 통과한 almost resolved로 나뉜다.

초기 결과는 낮다. 표에서는 Claude Opus 4.7이 almost resolved **3.0%**로 가장 높았고, Opus 4.6은 2.5%, Sonnet 4.6은 **1.0%**였다. GPT-5.4, Gemini 3.1 Pro, Gemini 3 Flash, Claude Haiku 4.5, GPT-5.4 mini, GPT-5 mini는 모두 resolved **0%**를 기록했다.

저자들은 mini-SWE-agent를 최소 공통 하니스로 사용해 과도한 하니스 튜닝을 피했고, 일부 실행은 Sonnet 4.5 기준 비용이 5,000달러까지 올라갔다고 밝혔다. ProgramBench는 현재 LLM 에이전트가 프로그램을 처음부터 설계하고 구현하는 능력에서 얼마나 멀리 와 있는지를 드러내는 벤치마크다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.