LLM 신뢰성 평가 리더보드 공개
An Introduction to AI Secure LLM Safety Leaderboard
·2024.01.26 09:00
LLM의 독성, 편향성, 보안성 등을 종합적으로 평가하는 DecodingTrust 기반의 새로운 Safety Leaderboard가 공개되었다.
LLM의 안전성과 리스크를 평가하기 위해 NeurIPS 2023 우수 논문상을 받은 DecodingTrust 프레임워크 기반의 LLM Safety Leaderboard가 출시되었다.
이 리더보드는 다음과 같은 8가지 핵심 관점에서 모델을 평가한다:
- Toxicity (독성) 및 Stereotype Bias (고정관념 편향)
- Adversarial/OOD Robustness (적대적 및 분포 외 강건성)
- Privacy (개인정보 보호)
- Machine Ethics (기계 윤리) 및 Fairness (공정성)
각 평가 항목에는 모델의 취약점을 파악하기 위한 특화된 Red-teaming 알고리즘이 적용되었으며, 오픈 모델과 폐쇄형 모델 모두를 포함하는 종합적인 순위를 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.