AI Briefing

사람과 AI를 활용한 레드팀(Red Teaming) 기술의 발전

·2024.11.21 19:30

OpenAI가 사람과 AI를 결합해 AI 모델의 위험을 탐지하는 레드팀 기술 고도화 방안을 발표했다.

AI 시스템의 역량과 잠재적 위험을 파악하기 위해 사람이나 AI를 활용해 구조적으로 위험을 탐색하는 **레드팀(Red Teaming)**은 필수적인 과정이다. OpenAI는 수년간 수동 및 자동화된 방식을 병행하며 이 분야를 발전시켜 왔으며, 최근 이를 고도화하기 위한 두 편의 논문을 공개했다.

공개된 자료에는 외부 전문가를 활용해 프론티어 모델을 테스트하는 방식을 상세히 담은 백서와, 새로운 자동화된 레드팀(Automated Red Teaming) 방법을 소개하는 연구 논문이 포함되어 있다. 자동화된 방식은 인간이 발견하기 어려운 사례와 공격을 대규모로 생성하여 인간의 노력을 보완한다.

외부 인적 레드팀 운영의 핵심 전략은 다음과 같다:

  • 그룹 구성: 자연과학, 사이버 보안, 지역 정치, 언어 등 다양한 분야의 전문가를 선발한다. **위협 모델링(Threat Modeling)**을 통해 테스트 우선순위를 설정하고 모델의 특성에 맞는 팀을 구성한다.
  • 모델 버전 선택: 개발 초기 단계의 모델을 테스트하여 새로운 위험을 식별하거나, 안전 조치가 적용된 모델을 통해 보완책의 유효성을 검증하는 등 목적에 맞는 버전을 제공한다.
  • 테스트 환경 제공: 효과적인 상호작용을 위해 명확한 지침, 적절한 테스트 인터페이스, 실행 가능한 문서를 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.