AI Briefing

Claude 3.5 Sonnet으로 SWE-bench Verified 기준 끌어올리기

·2025.01.06 00:00

업그레이드된 Claude 3.5 Sonnet이 SWE-bench Verified에서 49%를 기록했다.

업그레이드된 Claude 3.5 SonnetSWE-bench Verified에서 **49%**를 달성해, 이전 최고 기록인 **45%**를 넘어섰다. 핵심은 모델 자체뿐 아니라, 모델을 둘러싼 agent scaffolding을 어떻게 설계했는지에 있다.

SWE-bench는 실제 오픈소스 Python 저장소의 GitHub 이슈를 해결하는 능력을 평가한다. 모델은 문제 발생 직전의 저장소 체크아웃과 실행 환경을 받고, 코드를 이해·수정·테스트한 뒤 정답을 제출해야 하며, 평가는 실제 PR의 unit test 결과로 이뤄진다.

이 글은 SWE-bench가 단순한 모델 벤치마크가 아니라 모델 + 도구 + 실행 루프 전체를 평가한다고 강조한다. 성능은 같은 모델이라도 프롬프트, 출력 파싱, 다음 행동을 반영하는 방식 같은 scaffolding에 따라 크게 달라질 수 있다.

Anthropic이 만든 이번 agent는 의도적으로 단순하다.

  • Prompt, Bash Tool, Edit Tool만 제공해 모델이 스스로 문제 해결 전략을 선택하게 했다.
  • 긴 절차를 강제하기보다, 탐색부터 재현 스크립트 작성, 수정, 재실행, 엣지 케이스 점검까지 모델의 판단을 최대한 활용하도록 했다.
  • 툴 설계도 중요하게 다뤘다. 예를 들어 절대 경로를 강제하고, 파일 수정은 string replacement 중심으로 설계해 실수를 줄였다.

벤치마크 측면에서 SWE-bench-Verified는 원본 데이터셋 중 사람이 검토한 500개 문제만 추려, 실제로 풀 수 있는 과제만 남긴 버전이다. 이 글은 당시 아직 **50%**를 넘는 모델이 없었다고 설명하며, 이번 49%가 매우 높은 수준이지만 여전히 추가 개선 여지가 크다고 본다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.