UC Berkeley, 'Harness Tax' 연구 공개: 하네스별 비용 최대 5배 차이
HarnessTax: 7가지 모델 x 3가지 하네스로 실험한, 모델과 하네스에 따른 성능과 비용에 대한 연구 (feat. UC Berkeley)
핵심 내용
UC Berkeley 연구진이 코딩 에이전트 하네스 설계에 따라 동일 품질 달성 비용이 최대 5배까지 차이 나는 'Harness Tax' 현상을 규명했다.
자세히 보기
UC Berkeley Sky Computing Lab과 Arena 연구진이 코딩 에이전트 하네스(모델을 감싸는 소프트웨어 계층)가 성능과 비용에 미치는 영향을 분석한 연구 결과를 공개했다. 핵심 결론은 하네스 변경 시 과제 성공률은 거의 동일하게 유지되지만, 동일 품질을 달성하는 비용은 최대 5배까지 차이가 발생한다는 것이다. 이를 연구진은 'Harness Tax'라고 명명했다.
실험 설계 및 주요 발견
연구진은 7개 모델(Claude Fable 5, GPT-5.6 등)과 3개 하네스(Claude Code, Codex CLI, Pi)를 조합하여 SWE-bench Lite와 Terminal-Bench 2.0 벤치마크에서 통제된 조건으로 실험을 진행했다.
- 비용 격차: GPT-5.6 Luna 모델의 경우, Pi 하네스($0.030) 대비 Claude Code 하네스($0.152)를 사용할 때 성공률은 2.3%p 상승했지만 비용은 약 5배 증가했다.
- 성공률 안정성: 하네스 변경에 따른 성공률 변동은 제한적이었다.
- 파레토 프론티어: 도구 4개(read/write/edit/bash)만 제공하는 단순한 Pi 하네스가 두 벤치마크 모두에서 비용 대비 성능 파레토 프론티어를 달성했다.
비용 발생 원인 및 실무 함의
비용 차이의 주된 원인은 턴 수보다 컨텍스트 양의 차이에서 비롯된다. Claude Code는 첫 호출 시 27,011토큰의 초기 컨텍스트를 사용하는 반면, Pi는 1,972토큰에 불과하다. 복잡한 하네스일수록 초기 컨텍스트와 루프 길이가 급증하여 토큰 소모량이 커진다.
연구진은 모델 평가 시 하네스별 비용과 성공률을 동시에 비교해야 한다고 주장한다. 또한, 저가 모델이라도 비효율적인 하네스와 결합되면 해결당 비용이 더 높아질 수 있음을 지적하며, 작업 난이도에 따라 하네스의 역할이 달라진다는 점을 강조했다. 일상 작업에서는 모델 지능이 중요하지만, 복잡한 문제 해결에서는 하네스의 구조적 기여가 여전히 유효하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.