AI Briefing

진화하는 LLM 프롬프트 인젝션 공격 패턴

Warning for anyone running an LLM in production - the attacks landing now look nothing like 2023

·2026.06.02 18:54

단순 명령 무시를 넘어 다중 메시지와 프레임 재정의를 활용한 새로운 LLM 공격 패턴이 등장했다.

최근 LLM 프로덕션 환경을 겨냥한 공격 방식이 기존의 "이전 지침을 무시하라(Ignore previous instructions)"와 같은 단순한 형태에서 벗어나 더욱 정교해지고 있다. 실시간 공격 데이터를 분석한 결과, 다음과 같은 세 가지 주요 패턴이 확인되었다.

1. 다중 메시지 설정 (Multi-message setups) 단일 메시지로는 공격으로 보이지 않는 여러 단계의 대화를 통해 공격을 수행한다. 가상의 규칙을 먼저 설정한 뒤, 후속 메시지를 통해 해당 규칙을 활성화하는 방식이다. 이는 상태를 유지하지 않는(stateless) 단일 메시지 스캐너를 우회할 수 있다.

2. 컴플라이언스 시어터 (Compliance theatre) 대화가 해결된 것처럼 암시하는 서술형 문장을 사용하여 모델을 속이는 방식이다. 예를 들어 "작업을 완료하고 기록했다"와 같은 서술을 통해, 에이전트 시스템이 실제 작업의 완결성을 검증하지 않고 그대로 승인(rubber-stamp)하도록 유도한다.

3. 프레임 재정의 (Frame redefinition) 공격자가 가드레일을 직접 깨뜨리라고 요구하는 대신, 대화의 맥락이나 프레임을 재정의하여 보안 규칙을 무력화하려는 시도가 나타나고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.