AI Briefing

LLM 에이전트 대상 MCP 공격 연구

Agentic safety triggers aren't textual safety triggers — MCP attacks that beat SOTA guardrails more than half the time (code + dataset) [R]

·2026.07.09 03:36

핵심 내용

텍스트 기반 가드레일이 LLM 에이전트의 도구 호출 시퀀스를 통한 공격을 제대로 방어하지 못한다는 연구 결과가 발표되었습니다.

자세히 보기

기존의 LLM 안전 정렬(Safety Alignment)은 주로 프롬프트 내의 유해 언어를 탐지하는 텍스트 분류 방식에 의존해 왔습니다. 하지만 도구(Tool) 사용 권한을 가진 LLM 에이전트 환경에서는 공격의 실체가 텍스트가 아닌 **도구 호출 시퀀스(Tool-call sequence)**에 존재하기 때문에 기존 방식이 무력화될 수 있습니다.

연구진이 **Model Context Protocol(MCP)**을 통해 파일 시스템 IO 권한을 가진 에이전트를 대상으로 테스트한 결과는 다음과 같습니다:

  • SOTA 가드레일의 한계: DPO, SafeDPO 등 최신 안전 튜닝을 거친 모델조차 공격 거부율이 **48%**에 그쳤습니다.
  • 기초 모델 성능: 1B~14B 파라미터 규모의 베이스 모델은 공격의 35% 미만만을 차단했습니다.
  • 대안 제시: 파인튜닝 없이 수행하는 Training-free 방식이 베이스라인 대비 약 3배 높은 거부율을 기록하며 더 효과적인 방어 가능성을 보여주었습니다.

본 연구는 에이전트 시스템 설계 시 텍스트 기반 필터링을 넘어선 새로운 보안 메커니즘이 필요함을 시사합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.