선거 관련 리스크 테스트 및 완화 방안
·2024.12.20 03:53
Anthropic은 전문가 기반의 정책 취약성 테스트와 자동화된 평가를 통해 선거 관련 AI 리스크를 식별하고 완화한다.
2024년 전 세계적인 선거를 앞두고 Anthropic은 AI 모델이 선거 무결성을 해치지 않도록 리스크를 테스트하고 완화하는 프로세스를 구축했다. 이 과정은 전문가 중심의 **정책 취약성 테스트(Policy Vulnerability Testing, PVT)**와 대규모 **자동화된 평가(Automated Evaluations)**를 결합하여 운영된다.
PVT는 외부 전문가와 협력하여 진행되는 심층적인 정성적 테스트로, 다음과 같은 3단계로 구성된다:
- Planning: 선거 행정, 정치적 형평성, 허위 정보 생성 등 테스트할 정책 영역과 오용 사례를 선정한다.
- Testing: 일반적인 질문부터 레드팀 방식의 적대적 공격까지 다양한 프롬프트를 통해 모델의 답변을 검증한다.
- Reviewing results: 테스트 결과를 바탕으로 정책 및 안전 시스템의 공백을 파악하고 완화 우선순위를 결정한다.
식별된 리스크는 정책 업데이트, 도구 개선, 모델 파인튜닝(Fine-tuning) 등의 전략을 통해 완화된다. 이후 다시 테스트를 수행하여 개입의 효과를 측정하는 반복적인 과정을 거친다. Anthropic은 이 과정에서 개발한 자동화 평가 도구 일부를 Hugging Face를 통해 공개했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.