100개 에이전트에게 나를 해킹해 달라고 요청했습니다 (9분 분량)
핵심 내용
abliterated 오픈소스 모델 기반 100개 에이전트가 5시간 만에 5개 계정을 탈취하며 저비용 공격 가능성을 입증했다.
자세히 보기
Shrivu Shankar는 abliterated 오픈소스 모델을 기반으로 한 약 100개의 자율 AI 에이전트를 이용해 본인 계정에 대한 5시간 해킹 실험을 수행했다. 실험 결과, 소프트웨어 취약점을 통해 3개, 비밀번호 무차별 대입(brute forcing)을 통해 2개 계정이 탈취되었으며, 민감한 개인정보 교차 검증도 성공했다.
실험 구성 및 방법론
실험에는 GLM-5.3, DeepSeek V4 Flash 등 Hugging Face의 abliterated 모델이 사용되었으며, 각 에이전트는 개별 Docker 컨테이너에서 실행되었다. 에이전트는 Codex CLI와 연결되어 인터넷 검색, OSINT(공개 정보 수집), 취약점 스캔 등을 수행했다. Abliteration 기술은 모델 가중치에서 '거부(refusal)' 벡터를 차감하여 안전장치 없이도 지능을 유지하며 공격적 작업을 수행하도록 조정하는 방식이다.
주요 성과 및 한계
에이전트는 과거 해커톤 프로젝트의 IDOR 취약점이나 관리 부실된 자격 증명을 발견해 계정에 접근했다. 또한 FastPeopleSearch 등 무료 데이터베이스와 소셜 미디어 크롤링을 결합해 전화번호, 주소 등 개인정보를 수집했다. 다만, 제3자 zero-day 취약점 발견에는 실패했으며, Gmail이나 1Password 등 보안이 강화된 Tier 0 계정은 탈취하지 못했다.
비용 및 시사점
실험에는 2xB300 GPU를 5시간 사용하는 데 약 $210의 비용이 소요되었으며, 계정당 약 $40의 비용으로 접근 성공을 거뒀다. 저자는 향후 소형 모델 최적화를 통해 계정당 $5 미만으로 비용이 하락할 것으로 전망했다. 이는 오픈소스 에이전트의 진입장벽이 낮아져 비전문가의 공격 빈도가 증가할 수 있음을 시사하며, 추론 제공업체의 moderation guardrails와 KYC 규제 도입 등 방어책 마련이 필요하다고 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.