AI Briefing

지시 계층 구조: 특권 지시사항을 우선하도록 LLM 학습시키기

·2024.04.20 04:00

핵심 내용

LLM이 시스템 프롬프트의 우선순위를 인식하도록 학습시켜 프롬프트 인젝션 공격에 대한 방어력을 높이는 지시 계층 구조를 제안한다.

자세히 보기

현재의 LLM은 프롬프트 인젝션(prompt injection)이나 탈옥(jailbreak)과 같은 공격에 취약하다. 이는 모델이 개발자의 시스템 프롬프트와 신뢰할 수 없는 사용자의 입력을 동일한 우선순위로 처리하기 때문이다.

이를 해결하기 위해 서로 다른 우선순위를 가진 지시사항이 충돌할 때 모델이 어떻게 행동해야 하는지 명시적으로 정의하는 **지시 계층 구조(Instruction Hierarchy)**를 제안한다.

연구팀은 모델이 낮은 권한의 지시사항을 선택적으로 무시하도록 가르치는 데이터 생성 방법을 개발했다. 이 방법을 GPT-3.5에 적용한 결과, 학습 과정에서 보지 못한 공격 유형에 대해서도 강력한 방어력을 보여주었으며, 기존의 표준 성능 저하는 최소화했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.