LLM 하네스 회귀 테스터
What Is a Harness, Really? A Regression Tester for LLM Dev Tools
·2026.05.03 23:37
LLM 개발 도구의 하네스를 정의하고 회귀 테스트 도구를 제안했다.
harness를 모델 가중치와 사용자 사이의 벤더 제어 계층으로 정의했다. 이 계층에는 system prompt, default sampling parameters, context compaction, tool router, cache, redaction/safety, telemetry의 7개 구성요소가 들어간다. Claude Code의 2026년 4월 회귀 사례를 예로 들어, 모델 변경 없이도 하네스 변화가 품질을 바꿀 수 있다고 설명했다.
세 가지 예시도 제시했다.
- default reasoning effort 하향 조정
- session-cache 해시 버그로 오래된 컨텍스트 재사용
- system prompt의 verbosity limiter로 출력이 짧아짐
기존 APM과 단발성 A/B 테스트로는 이런 변화를 잡기 어렵기 때문에, 캡처한 코퍼스를 주기적으로 재생하는 harness-canary를 제안했다. 구조는 8개 시나리오, 7개 메트릭, baseline 대비 diff, 그리고 🟢/🟡/🔴 3단계 분류로 이뤄진다. 구현은 약 320줄 Python, 6개 모듈이다.
샘플 코퍼스에서는 35개 메트릭이 🟢, 8개가 🟡, 6개가 🔴였고, 핵심 회귀는 latency보다 도구 호출 수 증가, 분포 변화, retry 패턴 변화였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.