UiPath, Claude Code 스킬 활성화율 측정 및 개선 사례 공개
We measured whether our 20 skills actually fire. Baseline recall was 46%, and our first detector only understood Claude's Skill tool.
핵심 내용
UiPath가 Claude Code 스킬 활성화율을 측정해 베이스라인 46.3%에서 고유 마커 기반 설명으로 67.3%까지 개선했다.
자세히 보기
UiPath가 자사 Claude Code 스킬 20개의 활성화율을 측정하고, 이를 개선하는 과정에서 발견된 인사이트와 오픈소스 평가 도구를 공개했다.
스킬 활성화율 측정과 초기 문제
프로그레시브 디스클로저 방식에서 에이전트가 스킬을 선택하지 않으면 해당 스킬의 가치는 0에 가깝다. UiPath의 측정 결과, 초기 **마이크로 리콜(micro-recall)은 46.3%**로, 스킬이 작동해야 하는 프롬프트의 절반 이상이 아무 스킬도 호출하지 않았다.
첫 번째 발견은 평가 하네스 자체의 버그였다. 기존 검출기는 Claude의 Skill 도구 호출만 탐지하도록 설계되어, Skill 도구가 없는 Codex와 Antigravity는 스킬을 사용하지 않은 것으로 잘못 기록되었다. 실제로는 파일 읽기 방식으로 스킬을 적용하고 있었으며, Claude 역시 두 번째 스킬부터는 SKILL.md를 직접 읽는 경우가 있었다.
고유 마커 기반 설명 개선
스킬 설명에 해당 스킬만 소유한 고유 마커(파일명, 제품 고유 지표 등)를 명시하는 "Always invoke for X" 형식의 한 줄을 추가한 결과, 마이크로 리콜이 **46.3%에서 67.3%**로 상승했다. 특히 진단(diagnostics) 스킬은 0.16에서 0.68로, maestro-flow는 0.32에서 0.72로 크게 개선되었으며, 정밀도(precision)는 0.96 수준을 유지했다.
다만, 고유 마커가 없는 교차 기능 스킬(예: 'review')은 오히려 성능이 저하될 수 있어, 모든 스킬이 고유 마커로 앵커링될 수 있는 것은 아님을 시사했다.
오픈소스 평가 하네스 공개
에이전트와 평가 하네스가 동일 모델(Claude Code) 기반일 경우 하네스 버그와 에이전트 버그를 구분하기 어렵다는 점을 강조하며, 크로스 에이전트 평가용 Apache 2.0 오픈소스 하네스를 GitHub에 공개했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.