AI Briefing

새로운 코드 벤치마크 DeepSWE 공개

DeepSWE: new benchmark looking at how well today's frontier models can actually write code [R]

·2026.06.24 11:03

핵심 내용

데이터 오염을 방지하고 실제 소프트웨어 엔지니어링 복잡도를 반영한 새로운 코드 벤치마크 DeepSWE가 공개되었습니다.

자세히 보기

DeepSWE는 기존 벤치마크의 한계를 극복하기 위해 설계된 새로운 코드 작성 능력 평가 지표입니다. 주요 특징은 다음과 같습니다:

  • 데이터 오염 방지 (Contamination free): 기존 커밋이나 PR을 변형하는 방식이 아니라, 처음부터 새로 작성된 태스크를 사용하여 모델이 학습 과정에서 정답을 미리 접했을 가능성을 차단했습니다.
  • 높은 다양성: 5개 언어, 91개의 다양한 레포지토리를 활용하여 폭넓은 태스크를 제공합니다.
  • 실제적 복잡도: 프롬프트 길이는 SWE-bench Pro의 절반 수준이지만, 해결을 위해 필요한 코드 양은 5.5배, 출력 토큰 수는 2배 더 많아 실제 엔지니어링 환경과 유사합니다.
  • 신뢰할 수 있는 검증: 구현 세부 사항이 아닌 소프트웨어의 동작 자체를 테스트하도록 **수동으로 작성된 검증기(Verifiers)**를 사용합니다.

해당 프로젝트는 오픈 소스로 공개되어 누구나 활용할 수 있습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.