AI Briefing

UC Berkeley, 'Harness Tax' 연구 공개: 하네스별 비용 최대 5배 차이

HarnessTax: 7가지 모델 x 3가지 하네스로 실험한, 모델과 하네스에 따른 성능과 비용에 대한 연구 (feat. UC Berkeley)

·2026.09.19 18:30

핵심 내용

UC Berkeley 연구진이 코딩 에이전트 하네스 설계에 따라 동일 품질 달성 비용이 최대 5배까지 차이 나는 'Harness Tax' 현상을 규명했다.

1 / 8

자세히 보기

UC Berkeley Sky Computing Lab과 Arena 연구진이 코딩 에이전트 하네스(모델을 감싸는 소프트웨어 계층)가 성능과 비용에 미치는 영향을 분석한 연구 결과를 공개했다. 핵심 결론은 하네스 변경 시 과제 성공률은 거의 동일하게 유지되지만, 동일 품질을 달성하는 비용은 최대 5배까지 차이가 발생한다는 것이다. 이를 연구진은 'Harness Tax'라고 명명했다.

실험 설계 및 주요 발견

연구진은 7개 모델(Claude Fable 5, GPT-5.6 등)과 3개 하네스(Claude Code, Codex CLI, Pi)를 조합하여 SWE-bench Lite와 Terminal-Bench 2.0 벤치마크에서 통제된 조건으로 실험을 진행했다.

  • 비용 격차: GPT-5.6 Luna 모델의 경우, Pi 하네스($0.030) 대비 Claude Code 하네스($0.152)를 사용할 때 성공률은 2.3%p 상승했지만 비용은 약 5배 증가했다.
  • 성공률 안정성: 하네스 변경에 따른 성공률 변동은 제한적이었다.
  • 파레토 프론티어: 도구 4개(read/write/edit/bash)만 제공하는 단순한 Pi 하네스가 두 벤치마크 모두에서 비용 대비 성능 파레토 프론티어를 달성했다.

비용 발생 원인 및 실무 함의

비용 차이의 주된 원인은 턴 수보다 컨텍스트 양의 차이에서 비롯된다. Claude Code는 첫 호출 시 27,011토큰의 초기 컨텍스트를 사용하는 반면, Pi는 1,972토큰에 불과하다. 복잡한 하네스일수록 초기 컨텍스트와 루프 길이가 급증하여 토큰 소모량이 커진다.

연구진은 모델 평가 시 하네스별 비용과 성공률을 동시에 비교해야 한다고 주장한다. 또한, 저가 모델이라도 비효율적인 하네스와 결합되면 해결당 비용이 더 높아질 수 있음을 지적하며, 작업 난이도에 따라 하네스의 역할이 달라진다는 점을 강조했다. 일상 작업에서는 모델 지능이 중요하지만, 복잡한 문제 해결에서는 하네스의 구조적 기여가 여전히 유효하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.