AI Briefing

ReviewBench로 코드 리뷰 에이전트 평가하기

·2026.08.01 01:58

LangSmith 팀이 실제 PR 리뷰를 기반으로 코드 리뷰 에이전트 평가용 ReviewBench를 구축했다.

ReviewBench는 실제 코드 리뷰에서 발견된 문제를 바탕으로 코드 리뷰 에이전트의 성능을 평가하는 벤치마크다. LangSmith 모노레포의 병합된 PR에서 신뢰할 수 있는 리뷰어의 피드백을 수집한 뒤, 실질적인 결함만 선별해 재현 가능한 Harbor 태스크로 변환했다.

원본 리뷰 댓글에는 단순한 사소한 지적이나 질문도 섞여 있어 그대로 정답으로 사용할 수 없었다. 팀은 LLM 게이트와 수동 검토를 거쳐 변경으로 새롭게 발생한 문제이면서 검증 가능한 댓글만 남겼다.

벤치마크에는 다음과 같은 코드베이스 맥락 기반 문제가 포함된다.

  • 테넌트 조건 없이 ID만으로 데이터베이스 리소스를 조회·삭제하는 SQL 쿼리
  • 기존 API의 필터를 누락해 동작이 바뀐 엔드포인트 마이그레이션
  • 변경된 코드만 보는 것이 아니라 주변 코드에서 암묵적인 시스템 계약을 추론해야 하는 결함

현재 ReviewBench는 59개 태스크와 64개 기준 이슈로 구성됐다. 각 태스크는 고정된 PR 컨텍스트와 로컬 GitHub 스텁을 제공하며, 에이전트는 전체 저장소를 확인한 뒤 이슈 위치·제목·설명을 포함한 구조화된 리뷰를 제출한다.

평가는 기준 이슈를 찾아내는 커버리지와 제출한 지적 중 올바른 항목의 비율인 정밀도로 진행된다. 숨겨진 검증기가 LLM-as-a-judge 방식으로 결과를 비교하며, 최종 점수는 두 지표를 동일하게 반영한 F1이다. 모델별 비교는 동일한 Deep Agents 하네스와 태스크당 3회 시도로 수행했고, 리뷰 전용 시스템 프롬프트는 사용하지 않았다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.