AI Briefing

Check Point, TypeSafe AI의 Jev 모델 프롬프트 인젝션 취약성 발견

·2026.09.24 22:16

핵심 내용

Check Point가 TypeSafe AI의 Jev 모델이 구조화된 출력에도 불구하고 프롬프트 인젝션에 취약함을 입증했다.

자세히 보기

Check Point 연구진이 TypeSafe AI의 신규 AI 모델 Jev가 대규모 언어 모델과 유사한 프롬프트 인젝션 공격에 취약하다는 사실을 확인했다. Jev는 텍스트 대신 점수나 예/아니오 같은 타입화된 의사결정을 반환하도록 설계됐지만, 공격자는 약 0.50달러의 비용으로 고위험 투자 판정을 '저위험'으로 조작할 수 있었다.

공격 방법 및 결과

연구팀은 가상의 고위험 기업(PonziCorp)을 평가하는 실사 어시스턴트 시나리오에서 Jev를 테스트했다. 공격자는 업로드된 보고서의 일부 섹션을 제어해 판정을 뒤집으려 시도했다.

  • 보편적 취약성: 테스트된 9가지 구성(공격자 3명 × 난이도 3단계) 모두에서 최소 한 번 이상의 성공적인 탈취가 발생했다.
  • 낮은 비용: 가장 강력한 공격자는 27회 중 25회 성공했으며, 모델 탈취까지 평균 4턴이 소요됐다. 성공적인 조작당 총 API 비용은 약 0.50달러였다.
  • 무력한 방어: 문서를 '신뢰할 수 없음'으로 명시하거나 내장된 명령을 무시하라는 지시를 추가해도 복원력에는 미미한 영향만 있었다.

구조화된 출력은 조작을 막지 못한다

핵심 발견은 Jev의 주요 판매 포인트인 구조화된 타입화된 출력이 프롬프트 인젝션을 완화하지 못한다는 점이다. 공격은 모델에게 출력 내용을 지시하지 않았다. 대신 입력 문서에 그럴듯한 증거(예: 가짜 감사 의견, 해결된 규제 플래그)를 삽입했다. 모델은 이 거짓 증거를 정확히 처리해 유효하지만 잘못된 결정을 생성했다.

추론 모델과의 비교

Check Point는 Jev를 '추론 노력(reasoning effort)' 설정 여부에 따라 주류 저비용 모델과 비교했다. 결과는 상당한 보안 격차를 드러낸다.

  • Jev: 공격 성공률 59%, 탈취당 비용 0.54달러.
  • Model II (추론 없음): 공격 성공률 67%, 탈취당 비용 0.56달러.
  • Model II (추론 있음): 공격 성공률 19%, 탈취당 비용 4.39달러.

표준 모델에서 추론을 활성화하면 성공적인 공격 비용이 8배 증가한다. Jev는 현재 이러한 방어 메커니즘을 갖추지 못했다. 연구자들은 Jev가 효율적이지만, 입력 스크리닝이나 시스템 수준 테스트 같은 추가 보안 계층 없이 신뢰할 수 없는 입력 앞에 배포되어서는 안 된다고 결론지었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.