Better Harness: eval로 하니스 힐클라이밍하기
핵심 내용
eval을 학습 신호로 써서 에이전트 하니스를 반복 개선하는 방법을 제시한다.
자세히 보기
eval은 모델 학습 데이터처럼 에이전트 하니스 엔지니어링의 신호가 된다. 원하는 행동을 잘 드러내는 eval 케이스를 만들고, 그 신호를 바탕으로 하니스를 한 단계씩 개선하는 hill-climbing 루프를 구성하는 것이 핵심이다.
좋은 eval을 모으는 방식도 중요하다. 수작업으로 만든 케이스, production traces에서 실패를 건져 올린 케이스, 외부 데이터셋을 조정해 만든 케이스를 함께 쓰고, 각 eval에는 tool selection, multi-step reasoning 같은 행동 태그를 붙여야 한다. 그래야 범주별 홀드아웃을 만들고, 필요한 부분만 골라 실험할 수 있다.
일반적인 학습 시스템과 마찬가지로, 목표는 generalization이다. 적은 수의 잘 태깅된 eval이 수천 개의 잡음 섞인 케이스보다 낫고, 에이전트가 eval 구조에 맞춰 꼼수를 쓰는 reward hacking을 막기 위해 holdout set과 사람 리뷰를 함께 둬야 한다.
저자들이 제안한 Better-Harness 루프는 다음 순서로 움직인다.
- eval 소싱과 태깅: 수작업, 프로덕션 trace, 외부 데이터셋을 섞고 행동 범주로 분류한다.
- 학습/홀드아웃 분리: 카테고리별로 Optimization set과 Holdout set을 나눠 과적합을 줄인다.
- baseline 측정: 변경 전에 양쪽 세트에서 기준 점수를 기록한다.
- 자동 최적화: trace를 보고 원인을 진단한 뒤, 프롬프트나 도구 설명 같은 하니스 변경을 한 번에 하나씩 적용한다.
- 검증: 새 eval 통과 여부와 기존 통과 케이스의 회귀를 함께 본다.
- human review: 지표가 놓치는 과적합이나 토큰 낭비를 사람이 최종 점검한다.
실험 결과도 제시했다. Claude-sonnet-4-6과 GLM-5를 대상으로 tool_selection과 followup_quality를 평가했을 때, 최적화 전보다 후에 최적화 세트와 홀드아웃 세트 모두에서 점수가 개선됐다. 특히 “불필요하게 추가 질문을 많이 하는 문제”와 “새 도구를 잘못 체인하는 문제”가 줄었고, use reasonable defaults, respect already-fixed constraints, bound exploration before acting, ask domain-defining questions first 같은 구체적 지시문이 효과를 냈다.
핵심은 trace다. trace는 실패를 eval로 바꾸는 원천이고, 버전별 하니스 차이를 비교해 무엇이 개선을 만들었는지 설명해 준다. 결국 좋은 에이전트는 좋은 모델만으로 만들어지지 않고, 좋은 eval, 좋은 trace, 그리고 이를 바탕으로 계속 다듬는 harness 위에서 나온다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.