ReviewBench로 코드 리뷰 에이전트 평가하기
LangSmith 팀이 실제 PR 리뷰를 기반으로 코드 리뷰 에이전트 평가용 ReviewBench를 구축했다.
ReviewBench는 실제 코드 리뷰에서 발견된 문제를 바탕으로 코드 리뷰 에이전트의 성능을 평가하는 벤치마크다. LangSmith 모노레포의 병합된 PR에서 신뢰할 수 있는 리뷰어의 피드백을 수집한 뒤, 실질적인 결함만 선별해 재현 가능한 Harbor 태스크로 변환했다.
원본 리뷰 댓글에는 단순한 사소한 지적이나 질문도 섞여 있어 그대로 정답으로 사용할 수 없었다. 팀은 LLM 게이트와 수동 검토를 거쳐 변경으로 새롭게 발생한 문제이면서 검증 가능한 댓글만 남겼다.
벤치마크에는 다음과 같은 코드베이스 맥락 기반 문제가 포함된다.
- 테넌트 조건 없이 ID만으로 데이터베이스 리소스를 조회·삭제하는 SQL 쿼리
- 기존 API의 필터를 누락해 동작이 바뀐 엔드포인트 마이그레이션
- 변경된 코드만 보는 것이 아니라 주변 코드에서 암묵적인 시스템 계약을 추론해야 하는 결함
현재 ReviewBench는 59개 태스크와 64개 기준 이슈로 구성됐다. 각 태스크는 고정된 PR 컨텍스트와 로컬 GitHub 스텁을 제공하며, 에이전트는 전체 저장소를 확인한 뒤 이슈 위치·제목·설명을 포함한 구조화된 리뷰를 제출한다.
평가는 기준 이슈를 찾아내는 커버리지와 제출한 지적 중 올바른 항목의 비율인 정밀도로 진행된다. 숨겨진 검증기가 LLM-as-a-judge 방식으로 결과를 비교하며, 최종 점수는 두 지표를 동일하게 반영한 F1이다. 모델별 비교는 동일한 Deep Agents 하네스와 태스크당 3회 시도로 수행했고, 리뷰 전용 시스템 프롬프트는 사용하지 않았다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.