동일 모델 기반 AI 에이전트 하네스 9종 비교, 작업당 비용 최대 17배 차이
·2026.09.03 01:14
핵심 내용
동일한 LLM을 사용하는 9가지 AI 코딩 하네스를 비교한 결과, 작업 성공률과 비용 효율성에서 최대 17배의 차이가 발생했다.
자세히 보기
FrontierHarness v1.0 평가 결과, 동일한 모델과 환경을 사용하더라도 **AI 에이전트 하네스(Harness)**의 구현 방식에 따라 작업당 비용이 최대 17배까지 벌어지는 것으로 나타났다. Codex, Claude Code, OpenCode 등 9가지 주요 하네스를 대상으로 소프트웨어 엔지니어링 및 터미널 기반 작업을 수행했다.
비용과 성능의 괴리
- 비용 효율성 격차: 가장 효율적인 하네스는 작업당 $1 미만의 비용을 기록한 반면, 비효율적인 하네스는 $18.34까지 비용이 상승했다.
- 성공률과 비용의 비례하지 않음: Claude Code는 19개의 작업을 성공시켰지만, 높은 비용($18.34)이 발생했다. 반면 일부 하네스는 낮은 비용으로 유사한 성공률을 달성했다.
- 캐시 히트의 함정: 캐시 히트율이 높다고 해서 반드시 비용이 절감되는 것은 아니다. 300턴에 걸친 실패가 짧은 캐시 미스보다 더 많은 비용을 소모할 수 있다.
평가 방법론 및 한계
- 공정한 비교 환경: 모든 하네스는 Runta 에이전트 런타임에서 동일한 vCPU, 메모리, 디스크 상태의 골든 체크포인트에서 새로 복원되어 실행되었다.
- 적용 범위: 본 평가는 소프트웨어 엔지니어링 및 터미널 작업에 특화되어 있어, 다른 영역의 지식 노동에는 일반화되지 않을 수 있다.
- 데이터 보정: OpenCode의 경우 실패한 시도를 제외하고 15개 성공 작업만 집계되었으나, 실패 비용을 포함하면 작업당 비용이 $3.24로 증가한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.