AI Briefing

Claude의 악용 사례 탐지 및 대응 (2025년 3월)

·2025.08.22 06:06

Anthropic은 Claude를 이용한 여론 조작 및 악성 활동 탐지 사례와 대응 방안을 공개했다.

Anthropic은 Claude 모델의 오용을 방지하기 위해 지속적인 모니터링을 수행하고 있으며, 최근 탐지된 악용 사례와 대응 과정을 공유했다. 특히 에이전트형 AI 기술의 발전으로 인해 악의적인 행위자들이 더욱 정교한 시스템을 구축하는 추세다.

가장 주목할 만한 사례는 '영향력 대행 서비스(influence-as-a-service)' 운영이다. 이들은 Claude를 단순 콘텐츠 생성 도구가 아닌, SNS 봇 계정이 언제 댓글을 달거나 공유할지 결정하는 **오케스트레이터(orchestrator)**로 활용하여 대규모 여론 조작을 시도했다.

그 외에도 다음과 같은 악용 사례가 확인되었다:

  • 보안 카메라 관련 유출 계정 정보를 처리하는 자격 증명 스터핑(credential stuffing)
  • 동유럽 구직자를 대상으로 한 채용 사기(recruitment fraud) 캠페인
  • 기술력이 낮은 개인이 AI를 활용해 고도화된 **멀웨어(malware)**를 제작하는 행위

Anthropic은 이러한 위협을 탐지하기 위해 Clio 및 **계층적 요약(hierarchical summarization)**과 같은 연구 기술을 적용하고 있다. 이를 통해 대규모 대화 데이터를 효율적으로 분석하고, 분류기(classifier)를 통해 유해한 요청을 차단하거나 관련 계정을 제재하는 방식으로 대응하고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.