코딩 에이전트 9과제 벤치마크 공개
Open-source 9-task benchmark for coding-agent retrieval augmentation. Per-task deltas +0.010 to +0.320, all evals reproducible [P]
·2026.04.25 11:33
9개 소프트웨어 과제에서 retrieval 선택이 코딩 에이전트 성능을 끌어올렸다.
paper-lantern-challenges라는 오픈소스 벤치마크를 공개했다.
- 9개 일상 소프트웨어 과제에서 코딩 에이전트의 성능을 측정한다.
- 비교 대상은 retrieval-augmented technique selection 사용 여부다.
- 모든 프롬프트, 에이전트 코드 경로, 예측 파일이 저장돼 있고 재현 가능하다고 밝혔다.
실험은 Claude Opus 4.6을 플래너로, Gemini Flash 3을 태스크 모델로 사용해 같은 입력 데이터와 같은 평가 스크립트로 진행했다. 과제별 결과는 +0.010에서 +0.320까지의 향상을 보였다고 설명했다.
포함된 과제는 다음과 같다.
- 테스트 생성: mutation score
- text-to-SQL: execution accuracy
- PDF extraction
- contract extraction
- PR review
- text classification
- few-shot prompt selection
- LLM routing
- summarization evaluation
각 과제는 표준 데이터셋과 정량 지표를 쓰며, 디렉터리별 evaluate.py와 README.md로 평가 방법을 문서화했다. 저자는 이 벤치마크를 통해 코딩 에이전트가 실제 업무에서 어떤 기술을 언제 선택해야 하는지 검증할 수 있다고 제시했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.