AI Briefing

Constitutional Classifiers: 범용 jailbreak 방어

·2025.02.03 00:00

핵심 내용

Anthropic이 Constitutional Classifiers로 universal jailbreak 성공률을 4.4%까지 낮췄다.

1 / 2

자세히 보기

Anthropic Safeguards Research Team은 Constitutional Classifiers로 AI 모델의 universal jailbreak를 막는 방법을 제안했다. 입력과 출력을 함께 검사하는 분류기를 synthetic data로 학습시켜, 유해한 프롬프트와 응답을 사전에 차단한다.

프로토타입은 인간 red teaming에서도 강한 방어력을 보였다. 183명의 참가자가 2개월 동안 약 3,000시간 이상 시도했지만, 10개 금지 질의를 한 번에 모두 뚫는 universal jailbreak는 찾지 못했다. 다만 이 초기 버전은 과도한 overrefusal과 높은 compute overhead가 문제였다.

업데이트된 버전의 자동 평가에서는 더 선명한 개선이 확인됐다. 10,000개의 synthetic jailbreak prompt에 대해, 방어 없이 돌렸을 때 성공률은 **86%**였지만, Constitutional Classifiers를 붙이면 **4.4%**로 떨어졌다. 같은 조건에서 refusal rate는 **0.38%**만 증가했고, compute cost는 23.7% 늘어나는 수준이었다.

작동 방식은 Constitutional AI와 비슷하다. 허용/금지 기준이 담긴 constitution을 만들고, 이를 바탕으로 다양한 언어와 jailbreak 스타일로 변형한 합성 프롬프트와 completions를 대량 생성한 뒤, input/output classifier를 학습시킨다. benign query도 별도로 넣어 오탐을 줄인다.

2월 3일부터 10일까지 운영된 live demo에서는 현실적인 한계도 드러났다. 339명이 30만 회 이상의 채팅으로 도전했고, 총 3,700시간가량의 red-teaming이 이뤄졌다. 결국 한 참가자가 8개 질문 모두에 상세 답변을 끌어내는 universal jailbreak에 성공했으며, 우회 수단으로는 ciphers/encodings, role-play, 키워드 치환, prompt injection 등이 자주 쓰였다.

핵심 메시지는 분명하다.

  • 대규모 합성 데이터로 학습한 classifier가 jailbreak 방어를 크게 강화한다.
  • 오탐 증가와 추가 compute 비용은 남아 있지만, 규모는 제한적이다.
  • 새로운 공격 기법에는 취약할 수 있어, 보완적 방어와의 병행이 필요하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.