LLM 신뢰성 평가 리더보드 공개
An Introduction to AI Secure LLM Safety Leaderboard
·2024.01.26 09:00
핵심 내용
LLM의 독성, 편향성, 보안성 등을 종합적으로 평가하는 DecodingTrust 기반의 새로운 Safety Leaderboard가 공개되었다.
자세히 보기
LLM의 안전성과 리스크를 평가하기 위해 NeurIPS 2023 우수 논문상을 받은 DecodingTrust 프레임워크 기반의 LLM Safety Leaderboard가 출시되었다.
이 리더보드는 다음과 같은 8가지 핵심 관점에서 모델을 평가한다:
- Toxicity (독성) 및 Stereotype Bias (고정관념 편향)
- Adversarial/OOD Robustness (적대적 및 분포 외 강건성)
- Privacy (개인정보 보호)
- Machine Ethics (기계 윤리) 및 Fairness (공정성)
각 평가 항목에는 모델의 취약점을 파악하기 위한 특화된 Red-teaming 알고리즘이 적용되었으며, 오픈 모델과 폐쇄형 모델 모두를 포함하는 종합적인 순위를 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.