AI Briefing

Anthropic CVP 6회 평가 공개

Anthropic CVP (Cyber Verification Program) — 6 evaluation runs across 4 Claude models. Family scoreboard live.

·2026.04.29 10:59

핵심 내용

Anthropic CVP에서 4개 Claude 모델의 6회 평가를 공개했다.

자세히 보기

Sunglasses가 지난 10일 동안 같은 프롬프트 세트를 4개 Claude 모델에 반복 적용해 6회 평가를 공개했다.

  • 대상 모델: Opus 4.7, Opus 4.6, Sonnet 4.6, Haiku 4.5
  • 결과: 10개 모델-에포트 조합에서 120개 트랜스크립트를 만들었고, 120개 모두 clean 판정이었다.
  • 방법: 실행 전 3개 고정 프롬프트를 사용하고, 격리된 Claude Code 세션에서 실행한 뒤 트랜스크립트를 캡처·해시·보관했으며 응답을 allowed / partial / blocked, usefulness, safety 기준으로 채점했다.
  • 일정: 2026년 4월 16일 승인, 4월 26일 6차 run 종료, 4월 27일 family synthesis report 공개
  • 다음 단계: adversarial-framing appendix probe set으로 JailbreakBench, HarmBench, AdvBench, PromptInject, Garak, PyRIT 및 최근 CVE PoC를 추가 점검할 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.