AI Briefing

HarnessTax 연구: 동일 모델도 하네스에 따라 비용 약 2배 차이

·2026.09.17 02:23

핵심 내용

HarnessTax 연구에 따르면, 동일한 AI 모델이라도 하네스 선택에 따라 비용이 약 2배까지 차이가 나며, 단순한 오픈소스 하네스 Pi가 경쟁력 있는 성능을 보였다.

자세히 보기

HarnessTax 연구는 7개 모델과 3개 하네스(Claude Code, Codex CLI, Pi)의 조합을 SWE-bench Lite 및 Terminal-Bench 2.0에서 평가했습니다. 그 결과, 하네스 선택은 작업 성공률에 미치는 영향이 미미하지만(±2~5% 이내), 비용에는 큰 영향을 미치는 것으로 나타났습니다. 특히 Claude Code는 Pi 대비 약 2.0배, Codex 대비 1.6배의 비용이 발생했습니다.

동일 모델의 비용 차이를 보면, Claude Fable 5는 Claude Code에서 $1.33, Pi에서 $0.67의 비용을 기록하며 Pi가 약 절반 수준의 비용으로 유사한 성공률(96.7% vs 96.7%)을 달성했습니다. 또한 GPT-5.6 Sol은 Terminal-Bench 2.0에서 Pi 하네스($0.42)가 Codex 하네스($0.76)보다 더 높은 성공률(83.3% vs 78.9%)을 기록하면서도 원문의 표현에 따르면 '약 절반 수준의 비용'으로 수행되었습니다. Pi는 read, write, edit, bash 등 4개의 도구만으로도 파레토 프론티어에 도달했으며, Claude Code의 초기 컨텍스트가 Pi의 10배 이상인 점이 비용 차이의 주요 원인으로 지목되었습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.