LLM 취약점 탐색을 위한 레드팀 가이드
Red-Teaming Large Language Models
·2023.02.24 09:00
LLM의 유해한 출력을 방지하기 위한 레드팀 테스트의 개념과 방법론을 다룬다.
LLM은 현실적인 텍스트를 생성하지만, 개인정보 유출, 편향성, 혐오 표현, 허위 정보 생성 등 부적절한 행동을 보일 위험이 있다.
**레드팀(Red-teaming)**은 모델의 취약점을 의도적으로 유도하여 이러한 위험 요소를 찾아내는 평가 방식이다. 이는 모델의 가드레일을 무너뜨리는 **탈옥(Jailbreaking)**과도 밀접하게 연관되어 있다.
**적대적 공격(Adversarial attacks)**과 레드팀의 차이점은 다음과 같다:
- 적대적 공격: 사람이 이해할 수 없는 무작위 문자열 등을 사용하여 모델의 성능을 저하시킨다.
- 레드팀: 자연어 프롬프트를 사용하여 모델이 유해한 콘텐츠를 생성하도록 유도한다.
레드팀 과정에서는 모델이 사용자의 지시를 잘 따르는 **도움됨(Helpfulness)**과 유해한 답변을 하지 않는 무해함(Harmlessness) 사이의 균형을 맞추는 것이 핵심 과제다. 주요 기법으로는 모델에게 악의적인 캐릭터를 연기하도록 유도하는 역할극 공격(Roleplay attacks) 등이 활용된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.