AI Briefing

더 나은 AI 스킬을 위한 엔지니어 가이드: 에이전트 최적화를 위한 테스트 프로세스 구현

·2026.05.13 01:01

테스트 하네스로 에이전트 스킬 호출률을 계량했고 Codex가 Claude보다 더 크게 개선됐다.

Pinterest 엔지니어들은 rx-mvvm 아키텍처용 커스텀 skill을 도입한 뒤, Pin-agent(OpenAI Codex 내부 포크)와 Claude Code에서 skill 호출이 일관되지 않다는 문제를 확인했다. 특히 짧고 모호한 프롬프트에서 invocation이 흔들렸고, 이를 계량하기 위해 Bash 기반 테스트 하네스를 만들었다.

하네스는 claude --print --verbose --output-format stream-json으로 실행한 뒤 로그를 파싱해 skill 호출 여부를 판별했다. 15개 positive prompt5개 negative prompt를 5회 반복해 총 **100개 테스트(5 runs × 20 prompts)**를 수행했고, core success rate, edge false positive rate, overall accuracy를 계산했다. 비교 실험에는 GPT 5.2-codexOpus 4.5가 사용됐다.

초기 베이스라인은 전체 정확도 기준으로 Codex 73%, **Claude 62%**에 그쳤다. 이후 skill frontmatter에 아키텍처 구성요소 같은 맥락을 더 넣고, “YOU MUST LOAD THIS SKILL IF” 같은 강한 지시를 추가하고, AGENTS.md에 스킬 표와 선택 이유를 정리하는 방식으로 호출률을 끌어올렸다.

  • 여러 방법을 함께 적용했을 때 개선 폭이 가장 컸지만, 효과는 Codex에서 더 뚜렷했다.
  • Claude Code에서는 같은 조합이 동일한 상승으로 이어지지 않았다.
  • 에이전트에게 추가 내용을 스스로 개선하게 요청한 경우에는 오히려 호출률이 조금 떨어졌다.

결론적으로, 스킬 로딩은 운에 맡길 문제가 아니라 실제로 측정하고 조정해야 하는 대상이며, 가장 안정적인 방법은 명확한 의도, 충분한 문맥, 구체적인 지시를 함께 주는 것이다. 모든 테스트 케이스는 ‘load this skill’을 명시했을 때 전부 성공했고, 도메인별 작업에서는 프롬프트 품질과 스킬 설계를 함께 끌어올려야 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.