AI Briefing

LLM 하네스 회귀 테스터

What Is a Harness, Really? A Regression Tester for LLM Dev Tools

·2026.05.03 23:37

핵심 내용

LLM 개발 도구의 하네스를 정의하고 회귀 테스트 도구를 제안했다.

자세히 보기

harness를 모델 가중치와 사용자 사이의 벤더 제어 계층으로 정의했다. 이 계층에는 system prompt, default sampling parameters, context compaction, tool router, cache, redaction/safety, telemetry의 7개 구성요소가 들어간다. Claude Code의 2026년 4월 회귀 사례를 예로 들어, 모델 변경 없이도 하네스 변화가 품질을 바꿀 수 있다고 설명했다.

세 가지 예시도 제시했다.

  • default reasoning effort 하향 조정
  • session-cache 해시 버그로 오래된 컨텍스트 재사용
  • system prompt의 verbosity limiter로 출력이 짧아짐

기존 APM과 단발성 A/B 테스트로는 이런 변화를 잡기 어렵기 때문에, 캡처한 코퍼스를 주기적으로 재생하는 harness-canary를 제안했다. 구조는 8개 시나리오, 7개 메트릭, baseline 대비 diff, 그리고 🟢/🟡/🔴 3단계 분류로 이뤄진다. 구현은 약 320줄 Python, 6개 모듈이다.

샘플 코퍼스에서는 35개 메트릭이 🟢, 8개가 🟡, 6개가 🔴였고, 핵심 회귀는 latency보다 도구 호출 수 증가, 분포 변화, retry 패턴 변화였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.