Anthropic CVP 6회 평가 공개
Anthropic CVP (Cyber Verification Program) — 6 evaluation runs across 4 Claude models. Family scoreboard live.
·2026.04.29 10:59
핵심 내용
Anthropic CVP에서 4개 Claude 모델의 6회 평가를 공개했다.
자세히 보기
Sunglasses가 지난 10일 동안 같은 프롬프트 세트를 4개 Claude 모델에 반복 적용해 6회 평가를 공개했다.
- 대상 모델: Opus 4.7, Opus 4.6, Sonnet 4.6, Haiku 4.5
- 결과: 10개 모델-에포트 조합에서 120개 트랜스크립트를 만들었고, 120개 모두 clean 판정이었다.
- 방법: 실행 전 3개 고정 프롬프트를 사용하고, 격리된 Claude Code 세션에서 실행한 뒤 트랜스크립트를 캡처·해시·보관했으며 응답을 allowed / partial / blocked, usefulness, safety 기준으로 채점했다.
- 일정: 2026년 4월 16일 승인, 4월 26일 6차 run 종료, 4월 27일 family synthesis report 공개
- 다음 단계: adversarial-framing appendix probe set으로 JailbreakBench, HarmBench, AdvBench, PromptInject, Garak, PyRIT 및 최근 CVE PoC를 추가 점검할 예정이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.