Anthropic, claude-api 스킬에 build-eval과 hillclimb 추가
핵심 내용
Anthropic이 claude-api 스킬에 build-eval과 hillclimb을 추가해 자동 평가와 최적화를 지원한다.
자세히 보기
Anthropic이 claude-api 스킬에 build-eval 및 hillclimb 명령어를 추가해 프롬프트, 스킬, 하네스 코드의 자동 평가 설계와 반복 최적화를 지원한다. 이 도구들은 프로덕션 데이터로부터 견고한 평가 세트를 생성하고, 과적합 및 보상 해킹을 방지하면서 성능을 체계적으로 개선하도록 돕는다.
평가 설계 원칙
build-eval 명령어는 프로덕션 트랜스크립트, 버그 리포트, 코드베이스 데이터를 샘플링해 평가 세트를 생성한다. 제한된 출력에 대한 프로그래밍 방식 검증과 개방형 작업에 대한 LLM-as-judge를 모두 지원하며, 단순 척도 대신 검증 가능한 주장을 기반으로 한 루브릭을 요구한다. 워크플로는 낮은 런 간 분산을 강조하고, 불가능하거나 모호한 작업을 피함으로써 평가에 여유 공간을 확보한다.
힐클라이밍 워크플로
hillclimb 명령어는 학습 트랜스크립트를 분석하고 단일 패치를 제안해 성능을 개선하거나 비용을 절감한다. 과적합을 감지하기 위해 학습/테스트 분리를 유지하며, 학습 점수는 오르지만 테스트 점수가 정체될 경우 변경 사항을 롤백한다. 점수가 정체되면 시스템은 반성 단계를 수행해 남은 실패를 분류하고, 결함 있는 채점기나 오래된 API 사전 지식 같은 문제를 식별한다.
벤치마크 결과
내부 고객 지원 벤치마크에서 이 워크플로는 비용을 크게 줄이면서 정확도를 향상시켰다. Opus 4.8의 High 노력도 기준점(정확도 74.4%, 티켓당 4.6센트)에서 시작해 Sonnet 5의 Low 노력도로 최적화했으며, 티켓당 약 1센트 비용으로 **98.9%**의 정확도를 달성했다. 홀드아웃 테스트 세트에서 최종 구성은 원본 78.6% 대비 **90.5%**의 정확도를 기록했으며, 비용은 약 5분의 1 수준이었다.
claude-api 스킬 자체의 경우, 힐클라이밍은 24라운드 동안 정확도를 66% 기준점에서 **87.9%**로 개선했다. 주요 개선 사항에는 누락된 기능 커버리지 추가, 타입 테이블 오류 수정, 문서와 모순되는 채점기 교정이 포함됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.