SWE-sweep, 버그 능동 탐지 벤치마크 공개
New benchmark on LMs fixing bugs before users run into them
·2026.10.03 01:05
핵심 내용
Meta 등 연구진이 실제 버그를 능동적으로 찾는 SWE-sweep 벤치마크를 MIT 라이선스로 공개했다.
자세히 보기
Meta, Stanford, Harvard, UW 연구진이 SWE-sweep 벤치마크를 공개했다. 이 벤치마크는 사용자 보고 없이 대규모 코드베이스에서 언어 모델이 버그를 능동적으로 찾아 수정할 수 있는지 평가한다.
벤치마크 방법론
기존 벤치마크가 사용자가 발견한 특정 버그 수정을 요구하는 것과 달리, SWE-sweep은 에이전트에게 전체 코드베이스를 제공하고 가능한 한 많은 문제를 식별하고 해결하도록 한다. 점수는 저장소 내 숨겨진 실제 버그 집합을 기준으로 산정된다. 연구팀은 모든 버그가 코드만 읽고 발견 및 수정 가능하도록 엄격한 필터링을 적용했다.
초기 결과 및 공개 현황
초기 결과에 따르면 Luna xhigh가 현재 가장 높은 비용 효율성을 보이지만, 전체 점수는 예상보다 낮다. numpy 관련 작업 등 일부 태스크에서는 초인적 성능을 보이나, 소규모 저장소에서는 성능이 크게 저하된다. 프로젝트는 MIT 라이선스 하에 완전 오픈소스로 공개되며, 코드와 논문은 GitHub 및 프로젝트 웹사이트에서 확인할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.