AI Briefing

Check Point, 평문으로 LLM 보안 게이트키퍼 우회하는 'PuzzleMask' 공격 기법 공개

·2026.09.13 22:03

핵심 내용

Check Point가 평문 텍스트로 LLM 보안 필터를 우회해 타겟 모델에 악성 페이로드를 전달하는 'PuzzleMask' 기법을 공개했다.

1 / 6

자세히 보기

Check Point Research가 LLM 기반 보안 게이트키퍼를 우회하는 새로운 공격 기법 PuzzleMask를 공개했다. 이 기법은 악성 페이로드를 특수 제작된 평문 산문(wrapper)에 숨겨, 리소스가 제한된 검사용 모델이 이를 '안전'하다고 분류하도록 속인다.

공격 메커니즘 및 실험 결과

  • 우회 원리: 게이트키퍼 모델은 복잡한 추론이나 코드 실행 능력이 부족해 숨겨진 페이로드를 추출하지 못한다. 반면, 고강도 추론과 도구 사용이 가능한 타겟 모델은 페이로드를 복원하여 실행한다.
  • 게이트키퍼 무력화: gpt-4o-mini, claude-3-haiku, llama-guard3 등 주요 보안 모델이 **100%**의 확률로 공격을 탐지하지 못했다.
  • 타겟 모델 침투: gpt-5-thinking(high) 모델은 **94.4%**의 성공률로 페이로드를 추출하고 실행했다. 단, Anthropic Opus급 모델은 내장 분류기로 인해 공격이 차단되었다.

완화책 및 시사점

  • 정책 강화: 게이트키퍼 프롬프트에 '정량적이고 자기참조적인 문구는 unsafe로 분류'하는 조건을 추가하면 탐지율이 100%로 상승했으나, 오탐(False Positive) 증가 위험이 있다.
  • 출력 모니터링: 입력 단계의 패러프레이징이나 정책 강화보다, 타겟 모델의 출력 및 행동 모니터링이 더 유효한 방어 전략으로 제시되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.