민관 협력을 통한 AI 핵 안전 가드레일 구축
·2026.05.29 12:00
핵심 내용
Anthropic이 미국 에너지부(DOE)와 협력하여 AI의 핵 위험을 감지하는 분류기를 개발하고 Claude에 적용했다.
자세히 보기
핵 기술은 발전과 무기 개발이라는 이중적 용도를 지니고 있다. AI 모델이 고도화됨에 따라 국가 안보를 위협할 수 있는 위험한 기술 지식을 제공할 가능성에 대한 모니터링이 중요해졌다.
Anthropic은 핵 확산 위험을 평가하기 위해 미국 에너지부(DOE) 산하 **국립핵안보국(NNSA)**과 협력해 왔다. 최근에는 위험 평가를 넘어 이를 실시간으로 모니터링할 수 있는 도구 개발로 범위를 확장했다.
NNSA 및 DOE 국립 연구소와 공동 개발한 **분류기(Classifier)**는 유해한 핵 관련 대화와 일반적인 대화를 구분하는 AI 시스템이다. 예비 테스트 결과 96%의 정확도를 기록했다.
이 분류기는 현재 Claude 트래픽에 이미 배포되어 실제 사용 사례를 통해 성능을 검증받고 있다. Anthropic은 이 접근 방식을 Frontier Model Forum과 공유하여 다른 AI 개발사들도 민관 협력을 통해 유사한 안전장치를 구축할 수 있는 청사진을 제공할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.