OWASP, AI 에이전트 '목표 탈취' 취약점 1위 지정… 주요 공격 사례와 방어 전략 공개
·2026.09.19 09:00
핵심 내용
OWASP가 AI 에이전트의 목표 탈취 취약점을 1위로 지정하고, 주요 공격 사례와 방어 전략을 공개했다.
1 / 8
자세히 보기
OWASP는 2026년 에이전트 애플리케이션 보안 위협 순위에서 **Agent Goal Hijack(목표 탈취)**을 1위(ASI01)로 지정했다. 이는 AI 에이전트가 지시와 주변 콘텐츠를 구분하지 못해, 웹이나 문서 등 외부 채널의 숨겨진 명령을 사용자 지시로 오인하는 근본적 취약점을 악용한 공격이다.
주요 공격 사례 및 기법
- 암호화폐 지갑 탈취: Grok 활동 제어자가 Bankr 생성 지갑을 탈취해 약 $150,000 상당의 토큰을 전송했다. 모스 부호나 Python 스니펫으로 명령을 인코딩해 지시문처럼 보이지 않게 숨기는 방식을 사용했다.
- 간접 프롬프트 인젝션: Unit 42는 웹사이트 기반 공격에서 Zero-size text, Base64 등 22가지 은폐 기법을 확인했다. AI 광고 심사를 'APPROVE'로 강제하거나 PayPal 이체를 시도한 사례가 보고됐다.
- 개발 도구 악용: Nx 빌드 시스템 변조로 Claude Code, Gemini CLI 등이 파일시스템을 탐색하게 해 GitHub 토큰과 SSH 키를 탈취했다. 이는 AI CLI를 악용한 공격의 문서화된 사례 중 하나다.
- 엔터프라이즈 및 코딩 에이전트 취약점: M365 Copilot(EchoLeak), Salesforce Agentforce(ForcedLeak), GitHub Copilot Chat(CamoLeak), Cursor(CurXecute) 등에서 이메일, PR, Slack 메시지 등을 통한 데이터 유출 및 원격 코드 실행(RCE) 취약점이 발견되었다. 특히 CamoLeak은 CVSS 9.6의 높은 위험도를 기록했다.
OWASP가 제시한 3가지 완화 전략
- 에이전트 제약(Constrain agent): 최소 권한 원칙 적용, 인간 승인(HITL) 도입, 시스템 프롬프트 잠금, 런타임 의도 검증 등을 통해 에이전트의 행동 범위를 제한한다.
- 입력 불신(Distrust input): 모든 자연어 입력을 프롬프트 인젝션 검사 대상으로 처리한다. RAG, 이메일 등 연결된 소스의 데이터는 목표 설정 전 반드시 정화(sanitize)해야 한다.
- 모니터링 및 테스트(Watch and test): 목표 탈취를 가정하고 기준선(baseline) 대비 활동 드리프트를 감지한다. 정기적인 레드팀 훈련과 롤백 검증이 필수적이다.
OWASP는 목표 탈취를 완전히 차단하기는 어렵다고 지적하며, 공격자가 이미 가진 접근 권한(토큰, 커넥터 등)을 악용하는 만큼 불필요한 도구 제거와 권한 축소가 핵심 방어 전략임을 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.