새로운 코드 벤치마크 DeepSWE 공개
DeepSWE: new benchmark looking at how well today's frontier models can actually write code [R]
·2026.06.24 11:03
데이터 오염을 방지하고 실제 소프트웨어 엔지니어링 복잡도를 반영한 새로운 코드 벤치마크 DeepSWE가 공개되었습니다.
DeepSWE는 기존 벤치마크의 한계를 극복하기 위해 설계된 새로운 코드 작성 능력 평가 지표입니다. 주요 특징은 다음과 같습니다:
- 데이터 오염 방지 (Contamination free): 기존 커밋이나 PR을 변형하는 방식이 아니라, 처음부터 새로 작성된 태스크를 사용하여 모델이 학습 과정에서 정답을 미리 접했을 가능성을 차단했습니다.
- 높은 다양성: 5개 언어, 91개의 다양한 레포지토리를 활용하여 폭넓은 태스크를 제공합니다.
- 실제적 복잡도: 프롬프트 길이는 SWE-bench Pro의 절반 수준이지만, 해결을 위해 필요한 코드 양은 5.5배, 출력 토큰 수는 2배 더 많아 실제 엔지니어링 환경과 유사합니다.
- 신뢰할 수 있는 검증: 구현 세부 사항이 아닌 소프트웨어의 동작 자체를 테스트하도록 **수동으로 작성된 검증기(Verifiers)**를 사용합니다.
해당 프로젝트는 오픈 소스로 공개되어 누구나 활용할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.