AI Briefing

SWE-Lancer 벤치마크 소개

·2025.02.18 19:00

OpenAI가 실제 Upwork 프리랜서 업무를 기반으로 한 소프트웨어 엔지니어링 벤치마크 **SWE-Lancer**를 공개했다.

SWE-Lancer는 Upwork의 실제 프리랜서 소프트웨어 엔지니어링 작업 1,400여 개를 기반으로 구축된 벤치마크로, 총 가치는 약 100만 달러에 달한다.

이 벤치마크는 두 가지 유형의 작업을 포함한다:

  • 독립적 엔지니어링 작업: 50달러 규모의 버그 수정부터 32,000달러 규모의 기능 구현까지 포함하며, 숙련된 엔지니어가 3중 검증한 엔드 투 엔드 테스트로 평가한다.
  • 관리적 작업: 모델이 기술 구현 제안 중 하나를 선택하는 과제로, 실제 엔지니어링 매니저의 결정과 비교하여 평가한다.

평가 결과, 최신 Frontier LLM들은 여전히 대부분의 작업을 해결하지 못하는 것으로 나타났다. 연구 활성화를 위해 통합 Docker 이미지와 공개 평가 데이터셋인 SWE-Lancer Diamond를 오픈소스로 제공한다.

최근 업데이트를 통해 실행 중 인터넷 연결 요구 사항을 제거함으로써 모델 성능의 변동성을 최소화했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.