AI Briefing

SWE Tasks에서 13개 모델과 4개 에이전트 비교: Go, Java, Python, Rust, TS

·2026.08.01 00:28

111개 SWE 문제에서 Fable 5가 64.5%의 최고 해결률을 기록했다.

2026년 5월 15일~7월 1일 기간에 65개 저장소의 111개 SWE 문제를 대상으로 모델과 coding agent의 성능·비용을 비교했다.

해결률 기준 상위권은 다음과 같다.

  • Fable 5 [high]: 64.5%, 문제당 $4.40
  • Grok 4.5 [high]: 63.8%, $1.47
  • Claude Opus 5 [high]: 63.4%, $3.47
  • GLM-5.2 [high]: 62.9%, $1.40
  • GPT-5.6 Sol [medium]: 62.3%, $0.85

에이전트 중에서는 Junie(61.8%), Claude Code(60.4%), Codex(58.0%), Cursor(51.7%) 순으로 나타났다. Cursor는 문제당 $0.41로 측정된 에이전트 중 가장 저렴했다.

Pass@5 기준으로는 GLM-5.2가 **81.1%**로 가장 높았고, Fable 5가 78.4%, GPT-5.6 Sol이 79.3%를 기록했다. 해결률과 Pass@5가 반드시 일치하지 않아 단일 지표만으로 순위를 판단하기는 어렵다.

비용 효율에서는 MiMo V2.5 Pro($0.10), GPT-5.6 Luna($0.11), **DeepSeek-V4 Pro($0.15)**가 낮은 비용을 보였지만 해결률은 각각 46.5%, 43.6%, 40.2%였다. 다수의 기존 모델과 일부 최신 모델은 성능·비용 데이터가 N/A로 표시됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.