AI Briefing

코딩 에이전트 9과제 벤치마크 공개

Open-source 9-task benchmark for coding-agent retrieval augmentation. Per-task deltas +0.010 to +0.320, all evals reproducible [P]

·2026.04.25 11:33

9개 소프트웨어 과제에서 retrieval 선택이 코딩 에이전트 성능을 끌어올렸다.

paper-lantern-challenges라는 오픈소스 벤치마크를 공개했다.

  • 9개 일상 소프트웨어 과제에서 코딩 에이전트의 성능을 측정한다.
  • 비교 대상은 retrieval-augmented technique selection 사용 여부다.
  • 모든 프롬프트, 에이전트 코드 경로, 예측 파일이 저장돼 있고 재현 가능하다고 밝혔다.

실험은 Claude Opus 4.6을 플래너로, Gemini Flash 3을 태스크 모델로 사용해 같은 입력 데이터와 같은 평가 스크립트로 진행했다. 과제별 결과는 +0.010에서 +0.320까지의 향상을 보였다고 설명했다.

포함된 과제는 다음과 같다.

  • 테스트 생성: mutation score
  • text-to-SQL: execution accuracy
  • PDF extraction
  • contract extraction
  • PR review
  • text classification
  • few-shot prompt selection
  • LLM routing
  • summarization evaluation

각 과제는 표준 데이터셋과 정량 지표를 쓰며, 디렉터리별 evaluate.pyREADME.md로 평가 방법을 문서화했다. 저자는 이 벤치마크를 통해 코딩 에이전트가 실제 업무에서 어떤 기술을 언제 선택해야 하는지 검증할 수 있다고 제시했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.