지시 계층 구조: 특권 지시사항을 우선하도록 LLM 학습시키기
·2024.04.20 04:00
LLM이 시스템 프롬프트의 우선순위를 인식하도록 학습시켜 프롬프트 인젝션 공격에 대한 방어력을 높이는 지시 계층 구조를 제안한다.
현재의 LLM은 프롬프트 인젝션(prompt injection)이나 탈옥(jailbreak)과 같은 공격에 취약하다. 이는 모델이 개발자의 시스템 프롬프트와 신뢰할 수 없는 사용자의 입력을 동일한 우선순위로 처리하기 때문이다.
이를 해결하기 위해 서로 다른 우선순위를 가진 지시사항이 충돌할 때 모델이 어떻게 행동해야 하는지 명시적으로 정의하는 **지시 계층 구조(Instruction Hierarchy)**를 제안한다.
연구팀은 모델이 낮은 권한의 지시사항을 선택적으로 무시하도록 가르치는 데이터 생성 방법을 개발했다. 이 방법을 GPT-3.5에 적용한 결과, 학습 과정에서 보지 못한 공격 유형에 대해서도 강력한 방어력을 보여주었으며, 기존의 표준 성능 저하는 최소화했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.