AI Briefing
추천

DeepSWE: 장기적 엔지니어링 작업을 위한 코딩 에이전트 벤치마크

·2026.05.27 09:00

핵심 내용

DeepSWE는 오염 없는 데이터와 높은 복잡도를 갖춘 새로운 코딩 에이전트 벤치마크다.

자세히 보기

DeepSWE는 코딩 에이전트의 성능을 측정하기 위한 장기적(long-horizon) 소프트웨어 엔지니어링 벤치마크다. 기존 벤치마크의 한계를 극복하기 위해 다음과 같은 네 가지 핵심적인 발전을 이루었다.

  • 오염 방지(Contamination-free): 기존 커밋이나 PR을 변형한 것이 아니라 처음부터 새로 작성된 과제를 사용하여 모델이 사전 학습 과정에서 정답을 보았을 가능성을 차단했다.
  • 높은 다양성: 5개 언어, 91개 저장소를 아우르는 광범위한 풀을 제공한다.
  • 실제 환경의 복잡성: 프롬프트 길이는 짧지만, 해결을 위해 필요한 코드 양은 기존 대비 5.5배, 출력 토큰은 약 2배 더 많아 실제 개발 환경과 유사하다.
  • 신뢰할 수 있는 검증: 구현 세부 사항이 아닌 소프트웨어의 동작을 테스트하도록 수동으로 작성된 검증기를 사용한다.

기존의 선두 벤치마크인 SWE-bench Pro는 과제당 평균 코드 라인이 120줄에 불과하고, 검증 과정에서 높은 오차율을 보이는 한계가 있었다. 반면 DeepSWE는 모델 간의 성능 차이를 더욱 명확하게 구분해내며, 실제 개발자가 체감하는 에이전트의 성능 차이를 반영한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.