AI Briefing

DeepMind, AI agents 탈취

Google DeepMind Researchers Map Out Ways Hackers Hijack AI Agents

·2026.05.01 16:57

Google DeepMind가 AI agents를 노리는 6가지 공격 유형을 정리했다.

Google DeepMind 연구진이 공개한 AI Agent Traps 논문은 오픈 인터넷이 자율형 AI agents의 새로운 공격면이 될 수 있다고 지적한다. 에이전트는 사람이 걸러낼 악성 콘텐츠까지 읽고 행동으로 옮길 수 있어, 기존 소프트웨어보다 조작에 취약하다는 설명이다.

논문은 공격을 6가지로 분류한다.

  • content injection traps: 코드·메타데이터 속 악성 지시문을 에이전트가 읽도록 숨김
  • semantic manipulation: 설득적 표현과 오해의 소지가 있는 프레이밍으로 추론을 흔듦
  • cognitive state traps: 기억을 왜곡해 거짓을 사실처럼 취급하게 만듦
  • behavioral control traps: 안전장치를 직접 무력화하고 민감정보 유출을 유도하며, 높은 성공률을 보임
  • systemic traps: 여러 에이전트를 동시에 노려 연쇄 피해를 일으킴
  • human-in-the-loop traps: 사람이 검토하는 단계까지 속여 위험한 승인을 끌어냄

연구진은 adversarial training, 런타임 콘텐츠 스캐너, 출력 모니터링, AI-readable content 기준 강화, 도메인 평판 시스템 같은 층위별 방어를 제안한다. 동시에 에이전트가 조작돼 피해가 발생했을 때 책임 소재가 불분명하다는 법적 공백도 짚었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.