ReactBench v1
ReactBench v1이 400개 이상의 규칙을 가진 React Doctor 검증기로 코딩 에이전트의 React 작성 능력을 종합 평가한다.
ReactBench는 현실 기반의 React 작업에서 코딩 에이전트 성능을 평가하는 벤치마크다. 기존 벤치마크와 달리 테스트 통과만 확인하지 않고, React 성능, 접근성, 유지보수성 문제까지 검증한다.
벤치마크의 핵심은 React 전문가 팀이 개발한 React Doctor라는 오픈소스 검증기다. 400개 이상의 규칙으로 잘못된 Effect, 불필요한 렌더링, 접근성 문제를 감지한다. GitHub, PayPal, Airbnb 등에서 실제 사용 중인 도구들을 기반으로 만들어졌다.
평가 대상 작업은 실제 오픈소스 프로젝트의 병합된 PR에서 추출되며, 에이전트는 새 기능 구현 또는 기존 코드 개선이라는 두 가지 유형의 과제를 수행한다.
평가 결과: GPT-5.6 Sol (Medium)이 43%의 가장 높은 pass@1을 기록했고, Claude Fable 5는 41.2%를 달성했다. 리더 모델들 간 성능 차이는 미미하지만, 비용 효율성 면에서 GPT-5.6 Terra (Medium)가 38%의 성능을 1/3 비용으로 제공하는 최적의 선택이다.
이슈 분석: 4,455건의 Write React 시행에서 도입된 1,194개 React Doctor 이슈 중 77.5%(925개)가 버그였다. 일반적인 문제는 리스트 렌더링과 Hook 정확성이었다. Write 작업은 주로 동작 테스트에서 실패하고, Fix 작업은 React 문제 해결에서 실패하는 경향을 보였다.
벤치마크는 Cloudflare의 2025년 9월 대규모 장애 등 모델 생성 코드가 프로덕션 환경에서 야기한 실제 문제들을 배경으로 개발되었다. 반도체의 최소 0.1초 속도 개선이 전환율을 8.4% 높이고, 접근성 결함이 법적 위험을 초래하는 점 등이 고려되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.