AI 위해(Harm)를 이해하고 대응하기 위한 접근 방식
Anthropic이 AI의 물리적·심리적·경제적 영향을 포함한 광범위한 위해를 관리하기 위한 새로운 프레임워크를 공개했다.
AI 역량이 급격히 발전함에 따라, Anthropic은 생물학적 위협과 같은 파괴적 시나리오부터 아동 안전, 허위 정보, 사기 등 광범위한 **AI 위해(Harm)**를 평가하고 완화하기 위한 진화된 접근 방식을 공유했다.
이번 접근 방식은 파괴적 위험에 집중하는 **책임 있는 스케일링 정책(Responsible Scaling Policy, RSP)**을 보완하며, 보다 포괄적인 관점에서 위해를 관리하기 위해 설계되었다. 위해를 평가하는 기준은 다음과 같은 5가지 차원으로 분류된다.
- 물리적 영향: 신체적 건강 및 안녕에 미치는 영향
- 심리적 영향: 정신 건강 및 인지 기능에 미치는 영향
- 경제적 영향: 재정적 결과 및 재산 고려 사항
- 사회적 영향: 공동체, 기관 및 공유 시스템에 미치는 영향
- 개인 자율성 영향: 개인의 의사 결정 및 자유에 미치는 영향
각 차원에 대해 발생 가능성, 규모, 영향 범위, 지속성, 인과관계, 기술적 기여도, 완화 가능성 등을 종합적으로 검토한다. 위험의 심각도에 따라 사용 정책(Usage Policy) 수립, 레드팀(Red Teaming) 및 적대적 테스트를 포함한 평가(Evaluations), 오남용 탐지 기술, 그리고 계정 차단과 같은 강력한 집행(Enforcement) 조치를 병행한다.
예를 들어, 모델이 컴퓨터 인터페이스와 상호작용하는 Computer Use 기능의 경우, 금융 소프트웨어를 통한 사기나 통신 도구를 이용한 피싱 및 영향력 행사 캠페인 등의 위험을 사전에 식별하고 이에 맞는 모니터링과 집행 기준을 설계하여 적용한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.