ProgramBench: Language Models는 프로그램을 처음부터 다시 만들 수 있는가?
·2026.05.07 12:46
ProgramBench는 LLM의 전체 프로그램 재구성 능력을 대규모로 평가했다.
ProgramBench는 프로그램과 문서만 주고, 참조 실행 파일의 동작을 맞추는 코드베이스를 처음부터 다시 구현하게 하는 벤치마크다.
단일 버그 수정이나 단일 기능 구현이 아니라, 소프트웨어 아키텍처 결정까지 포함한 종합 개발 능력을 측정하도록 설계했다.
평가는 구현 구조를 미리 지정하지 않고, agent-driven fuzzing으로 만든 엔드투엔드 행동 테스트로 진행했다.
- 과제 수: 200개
- 범위: 소형 CLI 도구부터 FFmpeg, SQLite, PHP interpreter까지
- 평가 대상: 9개 LMs
- 결과: 어느 모델도 어떤 과제도 완전히 해결하지 못함
- 최고 성과: 전체 과제의 **3%**에서만 테스트 95% 통과
모델들은 사람 작성 코드와 달리 단일 파일 중심의 모놀리식 구현을 선호했고, 참조 구현과의 구조적 차이가 크게 나타났다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.