AI Briefing

AutoBe 벤치마크, 로컬 격차 축소

AutoBe benchmark: structured harness narrows frontier-vs-local gap in backend generation [D]

·2026.05.04 22:21

핵심 내용

AutoBe 벤치마크에서 structured harness가 frontier와 local 모델 격차를 좁혔다.

1 / 2

자세히 보기

AutoBe는 자연어 요청 하나로 requirements analysis, ERD, OpenAPI spec, E2E tests, NestJS implementation, type-safe SDK까지 만드는 backend generation benchmark다.

각 단계는 자유형 코드가 아니라 미리 정의된 AST를 function calling으로 채운다. 채점도 100점 만점 정적 분석만 사용해, 같은 artifact는 누가 돌려도 같은 점수를 받는다.

4월 leaderboard에서는 13개 모델이 약 5점 범위에 모였다. **GLM 5(82.8)**가 1위를 차지했고, **Claude Sonnet 4.6(82.2)**와 **Qwen 3.5-27B(81.8)**가 바로 뒤를 이었다. 일부 local 모델은 enterprise-scale backend를 100% compile success로 통과했다.

핵심 해석은 두 가지다.

  • 구조화된 harness와 재시도, diagnostics가 복잡한 타입 오류를 크게 줄였다.
  • backend generation에서는 모델 명성보다 harness 설계가 성능 차이를 더 크게 좌우할 수 있다.

비용도 크다. frontier 가격 기준 full run은 모델당 $1,000-$1,500 수준이며, 다음 라운드는 $0.25/M input 이하이거나 64GB unified-memory laptop에서 돌릴 수 있는 모델로 좁힐 계획이다.

다만 4개 reference projects만 쓴 만큼, procedural function-calling을 잘 따르는 모델에 유리했을 가능성은 남아 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.