미국 CAISI 및 영국 AISI와의 협업을 통한 AI 안전장치 강화
·2025.09.13 04:19
Anthropic이 미국과 영국의 AI 보안 기관과 협력하여 Claude 모델의 취약점을 점검하고 안전장치를 강화했다.
Anthropic은 지난 1년간 미국 CAISI(Center for AI Standards and Innovation) 및 영국 AISI(AI Security Institute)와 협력하여 AI 시스템의 보안을 측정하고 개선해 왔다. 초기 자문 단계에서 시작된 이 파트너십은 모델 개발의 다양한 단계에서 정부 팀이 시스템에 직접 접근하여 지속적인 테스트를 수행하는 방식으로 발전했다.
정부 기관은 사이버 보안, 정보 분석, 위협 모델링 분야의 전문성을 바탕으로 머신러닝 기술과 결합하여 정교한 공격 벡터와 방어 메커니즘을 평가한다. 이러한 협업은 탈옥(jailbreak)을 방지하는 Constitutional Classifiers를 Claude Opus 4 및 4.1 모델에 적용하여 취약점을 식별하는 데 중점을 두었다.
주요 식별된 취약점 및 개선 사항은 다음과 같다:
- 프롬프트 인젝션(Prompt Injection): 특정 주석을 사용하여 분류기 탐지를 우회하는 취약점을 발견하고 패치함.
- 안전장치 아키텍처 스트레스 테스트: 표준 탐지 방식을 회피하는 정교한 유니버설 탈옥을 발견하여, 개별 패치를 넘어 아키텍처 자체를 근본적으로 재구조화함.
- 암호 기반 공격(Cipher-based attacks): 암호화나 문자 치환을 통한 우회 시도를 탐지하고 차단할 수 있도록 시스템 개선.
- 입출력 난독화 공격: 유해한 문자열을 무해한 구성 요소로 분절하는 방식의 공격을 식별하여 필터링 메커니즘 강화.
- 자동화된 공격 정교화: 공격 전략을 최적화하는 자동화 시스템을 통해 생성된 탈옥 기법을 방어에 활용.
이번 협업은 단순한 취약점 발견을 넘어, 증거 요구 사항, 배포 모니터링, 신속 대응 역량 등 전반적인 보안 접근 방식을 강화하는 데 기여했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.