LLM 에이전트 대상 MCP 공격 연구
Agentic safety triggers aren't textual safety triggers — MCP attacks that beat SOTA guardrails more than half the time (code + dataset) [R]
·2026.07.09 03:36
텍스트 기반 가드레일이 LLM 에이전트의 도구 호출 시퀀스를 통한 공격을 제대로 방어하지 못한다는 연구 결과가 발표되었습니다.
기존의 LLM 안전 정렬(Safety Alignment)은 주로 프롬프트 내의 유해 언어를 탐지하는 텍스트 분류 방식에 의존해 왔습니다. 하지만 도구(Tool) 사용 권한을 가진 LLM 에이전트 환경에서는 공격의 실체가 텍스트가 아닌 **도구 호출 시퀀스(Tool-call sequence)**에 존재하기 때문에 기존 방식이 무력화될 수 있습니다.
연구진이 **Model Context Protocol(MCP)**을 통해 파일 시스템 IO 권한을 가진 에이전트를 대상으로 테스트한 결과는 다음과 같습니다:
- SOTA 가드레일의 한계: DPO, SafeDPO 등 최신 안전 튜닝을 거친 모델조차 공격 거부율이 **48%**에 그쳤습니다.
- 기초 모델 성능: 1B~14B 파라미터 규모의 베이스 모델은 공격의 35% 미만만을 차단했습니다.
- 대안 제시: 파인튜닝 없이 수행하는 Training-free 방식이 베이스라인 대비 약 3배 높은 거부율을 기록하며 더 효과적인 방어 가능성을 보여주었습니다.
본 연구는 에이전트 시스템 설계 시 텍스트 기반 필터링을 넘어선 새로운 보안 메커니즘이 필요함을 시사합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.