AI Briefing

맥락으로 평가를 짠다

Bootstrapping AI Evals from Context (Why 'Just Asking Claude' Fails)

·2026.04.17 02:28

핵심 내용

LLM 호출의 맥락을 Manifest로 압축해 평가 스택을 자동 부트스트랩한다.

자세히 보기

LLM 호출마다 Context Manifest를 먼저 만든다. 여기에는 해당 호출의 의도, 입력 유형, 주변 코드와 문서, 제약, 예시, 남아 있는 불확실성이 들어간다.

그다음 별도의 meta evaluator가 이 manifest를 바탕으로 Execution Contract를 만들고, 성공 기준을 정의해 실행 가능한 scorer들로 컴파일한다. 평가 스택의 생성과 검증을 같은 에이전트에 맡기지 않고, prosecutor-auditor-judges 패턴으로 역할을 분리하는 방식이다.

핵심은 “그냥 Claude에게 평가를 짜게 하자”는 접근의 한계를 피하는 데 있다.

  • 초기 trace 데이터가 적어도 시작할 수 있다.
  • 코드베이스의 prompts, policies, tests, docs 같은 로컬 컨텍스트를 먼저 활용한다.
  • 인간이 전체 평가 스택을 처음부터 수동 설계하지 않아도 된다.
  • 부족한 정책, 애매한 프롬프트, 테스트 데이터 공백 같은 context gaps를 명시적으로 드러낸다.

워크플로우는 단순하다.

  1. 코드 에이전트가 LLM call site를 조사해 manifest를 만든다.
  2. Scorable 같은 시스템이 그 manifest로 judge를 구성한다.
  3. 빠진 정보가 있으면 gap 목록을 되돌려준다.
  4. 개발자나 에이전트가 그 공백을 채우고 다시 돌린다.

이 방식의 장점은 프라이버시, 역할 분리, 초기 도입 난이도 감소, 평가 품질의 점진적 개선이다. 반면 초기 manifest가 틀리면 회복이 어려울 수 있고, 외부 observability 시스템에 의존하는 경우도 완전하지 않다고 한계도 짚는다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.