SWE-bench Verified 소개
·2024.08.13 19:00
핵심 내용
OpenAI가 AI의 소프트웨어 엔지니어링 능력을 더 정확하게 평가하기 위해 인간이 검증한 **SWE-bench Verified**를 공개했다.
자세히 보기
OpenAI는 모델의 자율적 행동 능력을 추적하는 Preparedness Framework의 일환으로, AI의 소프트웨어 엔지니어링 능력을 더욱 정밀하게 평가할 수 있는 SWE-bench Verified를 출시했다. 이는 기존 SWE-bench가 모델의 실제 역량을 과소평가할 수 있는 문제를 해결하기 위해 인간이 직접 검증한 데이터셋이다.
기존 SWE-bench는 GitHub의 이슈와 PR을 활용해 AI 에이전트의 성능을 측정하지만, 다음과 같은 세 가지 주요 한계가 발견되었다:
- **단위 테스트(Unit Test)**가 지나치게 구체적이거나 이슈와 무관하여 올바른 솔루션을 오답으로 처리함
- 이슈 설명이 불충분하여 문제의 의도가 모호함
- 개발 환경 설정 문제로 인해 유효한 코드가 실패로 처리됨
SWE-bench Verified는 이러한 문제를 개선하여 AI 에이전트가 실제 세계의 소프트웨어 문제를 해결하는 능력을 더욱 신뢰성 있게 측정할 수 있도록 돕는다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.