가드의 사각지대: 도메인 위장 인젝션 공격이 멀티 에이전트 LLM 시스템의 탐지를 회피하는 방법
·2026.05.23 03:46
LLM 에이전트 보호용 인젝션 탐지기가 도메인 위장 공격에 탐지율 93.8%→9.7%로 급락
LLM 에이전트를 보호하기 위해 배포된 인젝션 탐지기는 정적 템플릿 기반 공격 페이로드에 맞춰 조정되어 있다. 연구진은 공격 페이로드가 대상 문서의 도메인 어휘와 권위 구조를 모방하도록 생성될 경우 표준 탐지기가 이를 탐지하지 못하는 체계적 사각지대를 발견했다.
탐지율 급락
- Llama 3.1 8B: 93.8% → 9.7%
- Gemini 2.0 Flash: 100% → 55.6%
- Llama Guard 3 (프로덕션 안전 분류기): 위장 페이로드 탐지율 0%
연구진은 이를 **Camouflage Detection Gap (CDG)**으로 정식화했다. 3개 도메인, 45개 태스크, 2개 모델 패밀리에서 CDG는 통계적으로 유의미하게 크게 나타났다 (Llama: chi² = 38.03, p < 0.001 / Gemini: chi² = 17.05, p < 0.001).
멀티 에이전트 시스템의 증폭 효과
멀티 에이전트 토론(debate) 아키텍처는 작은 모델에서 정적 인젝션 공격을 최대 9.9배 증폭시킨다. 반면 강력한 모델은 집단 저항성을 보인다.
타겟 탐지기 보강(augmentation)은 부분적 개선만 제공했다 (Llama 10.2%, Gemini 78.7%). 이는 취약성이 우발적이 아니라 아키텍처적 문제임을 시사한다.
프레임워크, 태스크 뱅크, 페이로드 생성기가 공개되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.