프롬프트 인젝션 방어: AgentCore 기반 다층 보안 설계 패턴
·2026.06.11 09:20
LLM 에이전트의 보안 경계는 모델 내부가 아닌 시스템 외부에 구축해야 한다.
LLM 기반 에이전트를 프로덕션에 적용할 때 가장 큰 위협은 프롬프트 인젝션이다. 많은 팀이 시스템 프롬프트에 보안 규칙을 명시하여 해결하려 하지만, LLM은 확률론적 모델이기에 지시문을 무시하거나 조작될 가능성이 항상 존재한다.
특히 **간접 프롬프트 인젝션(Indirect Prompt Injection)**은 사용자 메시지뿐만 아니라 도구 응답, RAG 검색 결과, 메모리 요약 등 다양한 경로를 통해 발생할 수 있다. Anthropic의 Agent Red Teaming(ART) 벤치마크에 따르면, 가장 강력한 모델조차 100번의 시도 중 수 차례 공격에 성공할 만큼 완벽한 방어가 어렵다.
따라서 보안 경계는 반드시 LLM 바깥에 위치해야 한다. 주요 대응 전략은 다음과 같다.
- 에이전트 권한 관리: 도구(Tool) 파라미터에
user_id를 직접 포함하는 안티 패턴을 피해야 한다. 대신 에이전트가 사용자 ID를 인지하지 못하게 하고, 시스템이 호출 시점에 사용자 정보를 주입하는 방식을 사용해야 한다. - 정보 유출 방지: 도구의 응답 데이터에서 민감한 필드를 사전에 제거하여 모델에 전달되는 정보의 범위를 제한해야 한다.
결국 모델의 판단력에 보안을 맡기는 것이 아니라, 시스템 차원의 제어를 통해 데이터 접근 권한을 강제하는 설계가 필수적이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.