AI Briefing

SWE-sweep 벤치마크 출시로 능동적 버그 발견 평가

Luna and Sol doing extremely well on new benchmark about finding bugs before users run into them

·2026.10.03 00:55

핵심 내용

Meta 등 연구진이 AI 에이전트의 능동적 버그 발견을 평가하는 SWE-sweep 벤치마크를 공개했다.

자세히 보기

Meta, Stanford, Harvard, UW 연구진이 AI 에이전트가 사용자 보고 전에 실제 버그를 능동적으로 발견하고 수정하는 능력을 평가하는 새로운 벤치마크 SWE-sweep을 공개했다. 기존 벤치마크가 알려진 버그 수정에 집중했던 것과 달리, SWE-sweep은 대규모 코드베이스를 제공해 숨겨진 실제 버그 세트를 기준으로 점수를 매긴다.

주요 발견

  • Luna xhigh는 Sol의 점수 절반 수준을 달성하면서도 비용은 극히 일부만 소요해 높은 비용 효율성을 입증했다.
  • Anthropic 모델 등 다양한 모델의 성능을 비교한다.
  • 평가에 사용된 모든 버그는 실제 저장소에서 발견된 실제 문제다.

리소스

전체 리더보드, 구성 방법론 및 설명 논문은 swesweep.com에서 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.