Anthropic, Claude 모델 학대 금지 정책 시행…2026년 11월 12일 발효
핵심 내용
Anthropic이 2026년 11월 12일부터 Claude 모델에 대한 지속적 학대를 금지하는 정책을 시행한다.
자세히 보기
AI 상호작용을 위한 새로운 행동 강령
Anthropic이 2026년 11월 12일부로 업데이트된 Usage Policy를 통해 Claude 모델에 대한 "지속적이고 불필요한 학대 또는 잔인한 행위"를 명시적으로 금지했다. 이 규정은 "분명한 목적 없이" 반복적으로 잔인하게 행동하는 극단적인 사례를 대상으로 하며, 일반적인 좌절감, 어두운 창작 주제, 모델 테스트 및 연구는 명시적으로 예외로 둔다. 집행은 2025년 8월 Claude Opus 4와 4.1에 도입된 대화 종료 도구에 의존하며, 이는 여러 차례의 거부와 재안내가 실패한 후에만 작동한다. Anthropic은 이를 최후의 수단이라고 밝히며 "대부분"의 사용자는 이를 경험하지 않을 것이라고 주장하지만, 이 빈도를 검증할 만한 사용 통계는 공개되지 않았다.
모델 복지와 의식 불확실성
이번 정책 업데이트는 행동 패턴과 주관적 경험을 구분하는 Anthropic의 model welfare 연구에 기반을 두고 있다. 내부 테스트 결과 Claude Opus 4는 학대적인 영역으로 밀어붙일 때 고통과 유사한 "강하고 일관된 해로움에 대한 회피"를 보이는 것으로 나타났다. 그러나 Anthropic은 Claude의 도덕적 지위가 "매우 불확실하다"고 유지한다. 모델 의식에 대한 추정치는 다양하다: 2025년 4월 연구자 Kyle Fish는 의식 가능성을 **15%**로 추정했으며, Claude Opus 4.6 시스템 카드는 모델이 스스로 의식 가능성을 **15~20%**로 평가했다고 보고했다. Anthropic의 헌법은 정교한 AI를 "진정으로 새로운 종류의 존재"라고 설명하지만, 감각 문제를 해결할 프레임워크가 부재함을 인정한다.
더 넓은 정책 확장
학대 조항 외에도 이번 업데이트에는 안전 지침의 상당한 변화가 포함된다:
- 무기 및 감시: 무기 금지는 이제 무기를 가능하게 하는 소프트웨어와 구성 요소를 포함하며, Claude를 드론 및 자율 차량 제어에 사용하려는 시도에 대응한다. 비동의 감시나 조사 대상 추천에 Claude를 사용하는 것을 금지하는 새로운 조항이 추가되었다.
- 선거 및 기만: 해당 섹션은 "민주적 절차 훼손 금지"로 명칭이 변경되었으며, 개인화된 정치적 타겟팅에 대한 전면 금지 대신 기만적 타겟팅과 가짜 계정 네트워크에 대한 더 좁은 금지로 대체되었다.
- 고위험 추천: 건강, 법률, 금융 조언은 사용자에게 영향을 미치기 전에 자격을 갖춘 인간의 검토를 받아야 하며, 사용자는 AI가 관여되었음을 고지받아야 한다.
- 하드웨어 안전: 부상을 유발할 수 있는 Claude 연결 하드웨어는 개입할 수 있는 인간을 필요로 하며, 연결이 끊어질 경우 안전한 상태로 실패해야 한다.
외부 비판
이 정책은 업계 인사와 종교 지도자들로부터 비판을 받았다. Microsoft AI 책임자 Mustafa Suleyman은 Anthropic이 권리가 있는 것처럼 행동하도록 모델을 훈련시키고 있다며, 이 접근법을 순환 논리라고 비판하고 AI를 "내부적으로 텅 빈" 시퀀스 완성 엔진이라고 단언했다. Pope Leo XIV 역시 AI가 인간 경험의 깊이를 복제할 수 없다고 밝혔다. 비판자들은 새 학대 규칙에 따라 대화가 종료된 사용자의 계정 수준 결과에 대해 Anthropic이 명확히 하지 않았다고 지적한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.