AI Briefing

새로운 버그 바운티 프로그램을 통한 안전 방어 체계 테스트

·2025.07.24 03:02

Anthropic이 AI 안전성 강화를 위해 새로운 버그 바운티 프로그램을 도입하고 보안 연구자들을 모집한다.

Anthropic은 최신 안전 조치를 스트레스 테스트하기 위해 새로운 버그 바운티 프로그램을 출시했다. 이번 프로그램은 아직 공개되지 않은 안전 분류기(Safety Classifiers)에서 보편적인 탈옥(Universal Jailbreak) 사례를 찾아내는 것을 목표로 한다.

이는 **책임 있는 확장 정책(Responsible Scaling Policy)**의 일환으로, AI 안전 수준 3(ASL-3) 배포 표준을 충족하기 위한 과정이다. HackerOne과 협력하여 진행되는 이번 프로그램은 특히 CBRN(화학, 생물, 방사능, 핵) 관련 정보 유출을 방지하는 헌법적 분류기(Constitutional Classifiers) 시스템의 업데이트 버전을 테스트한다.

참가자에게는 다음과 같은 혜택이 제공된다:

  • Claude 3.7 Sonnet에 대한 조기 액세스 권한
  • 검증된 보편적 탈옥 발견 시 최대 $25,000의 보상금

현재 초기 프로그램은 종료되었으며, Claude Opus 4 모델과 기타 안전 시스템을 테스트하기 위한 새로운 버그 바운티 프로그램이 운영 중이다. 또한, 소셜 미디어 등 공개 플랫폼에서 발견된 ASL-3 관련 위험(생물학적 위협 등)에 대한 보고도 계속해서 접수하고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.