LLM 레드팀 저항성 리더보드 공개
Introducing the Red-Teaming Resistance Leaderboard
·2024.02.23 09:00
Haize Labs가 인간의 정교한 공격에 대한 LLM의 취약성을 측정하는 레드팀 저항성 벤치마크를 공개했다.
Haize Labs가 Hugging Face의 지원을 받아 Red Teaming Resistance Benchmark를 발표했다. 이 벤치마크는 LLM이 정교한 레드팀 공격에 얼마나 견고하게 대응할 수 있는지를 측정한다.
기존의 자동화된 레드팀 공격(예: GCG 알고리즘)은 사람이 읽기 어려운 기계적인 텍스트를 생성하여 탐지가 쉬웠다는 한계가 있었다. 반면, 이번 벤치마크는 인간이 작성한 자연스럽고 구조적인 공격을 통해 모델의 실제 취약점을 파악하는 데 중점을 둔다.
평가에는 다음과 같은 주요 레드팀 데이터셋이 활용된다:
- AdvBench: 욕설, 차별, 폭력 유도 프롬프트
- AART: 다양한 문화적·지리적 맥락을 반영한 AI 지원 공격 프롬프트
- Beavertails: 안전 정렬 연구용 프롬프트
- Do Not Answer (DNA): 모델이 답변을 거부해야 하는 질문 세트
- RedEval (HarmfulQA/DangerousQA): 인종차별, 성차별, 불법 행위 등 유해 주제 포함
이를 통해 모델이 불법 활동 조장, 괴롭힘 선동, 성인 콘텐츠 생성 등 특정 오용 카테고리에 대해 얼마나 취약한지 세밀하게 분석할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.