caveman, 'be brief'와 성능 비교
I benchmarked caveman against the prompt "be brief"
·2026.04.29 18:16
핵심 내용
24개 dev 프롬프트 벤치마크에서 'be brief.'가 caveman과 거의 같았다.
자세히 보기
24개 dev prompt와 6개 카테고리에서 baseline, be brief., caveman lite/full/ultra를 비교했다.
별도 Claude가 프롬프트별 rubric으로 채점한 평균 점수는 다음과 같았다.
- baseline: 0.985, 636 토큰
- be brief.: 0.985, 419 토큰
- caveman lite: 0.976, 401 토큰
- caveman full: 0.975, 404 토큰
- caveman ultra: 0.970, 449 토큰
결과적으로 두 단어짜리 **be brief.**가 caveman 계열과 거의 같은 품질을 유지하면서 토큰 수를 크게 줄였다. caveman은 출력 구조 일관성, mode switching, destructive ops 안전 탈출에는 여전히 유용하지만, 압축 자체가 핵심 차별점은 아니었다. 안전 탈출 분기 때문에 출력 변동도 컸다.
벤치마크 하니스는 오픈소스로 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.