모델 안전성 버그 바운티
·2024.09.11 02:28
Anthropic이 차세대 AI 안전 시스템의 '유니버설 탈옥' 취약점을 찾기 위한 새로운 버그 바운티 프로그램을 시작한다.
Anthropic이 AI 모델 오용을 방지하기 위한 차세대 안전 시스템의 결함을 찾기 위해 버그 바운티(Bug Bounty) 프로그램을 확장한다. 이번 프로그램은 다양한 영역에서 AI 안전 가드레일을 지속적으로 우회할 수 있는 유니버설 탈옥(Universal Jailbreak) 공격을 식별하고 완화하는 데 집중한다.
특히 CBRN(화학, 생물, 방사능, 핵) 및 사이버 보안과 같은 고위험 분야의 취약점을 해결하는 것을 목표로 한다. 참여자에게는 아직 공개되지 않은 차세대 안전 완화 시스템에 대한 얼리 액세스(Early Access) 권한이 부여된다.
프로그램의 주요 내용은 다음과 같다:
- 보상 규모: 참신하고 유니버설한 탈옥 공격 발견 시 최대 $15,000 지급
- 운영 방식: HackerOne과 협력하여 초기에는 초대 기반(Invite-only)으로 운영
- 신청 방법: AI 보안 연구자 등 전문가는 8월 16일까지 신청 양식을 통해 지원 가능
이번 이니셔티브는 백악관의 자발적 AI 약속(Voluntary AI Commitments) 및 G7 히로시마 프로세스의 고급 AI 시스템 개발 조직 행동 강령 등 국제적인 책임 있는 AI 개발 노력과 궤를 같이한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.