연구진, LLM 암호화 추론 블록 취약점 발견…개인정보 및 프롬프트 주입 공격 가능
·2026.09.08 19:20
핵심 내용
LLM의 암호화된 추론 블록이 세션 간 호환되는 취약점을 이용해 개인정보를 탈취하고 프롬프트 주입 공격을 수행하는 방법이 공개됐다.
자세히 보기
주요 LLM 제공사들은 지적 재산 보호를 위해 모델의 단계별 추론 과정(chain-of-thought)을 서버에 저장하지 않고, 클라이언트로 암호화된 텍스트 블록을 반환하는 방식을 사용한다. 그러나 연구진은 이 암호화된 추론 블록이 동일 제공사 생태계 내의 다른 세션, 사용자, 모델 간에 완전히 호환되고 교체 가능하다는 아키텍처 취약점을 발견했다.
연구진은 이 호환성을 악용해 확장 가능한 **복호화 제일브레이크(decryption jailbreak)**를 개발했다. 특정 모델의 암호화된 추론 블록을 동일 제공사의 안전장치가 약한 하위 모델에 주입하면, 하위 모델이 이를 평문으로 복호화하여 그대로 출력하도록 강제할 수 있다. 이 방법은 상위 모델을 직접 제일브레이크 하지 않고도 작동한다.
이 취약점은 네 가지 공격 벡터를 가능하게 한다:
- 증류 방지 우회: Anthropic, OpenAI, Google 등에서 독점 모델의 추론 과정을 추출할 수 있다.
- 대규모 개인정보 탈취: 공개 저장소에서 수집한 315,320개의 추론 블록을 복호화하여 367개의 개인정보(PII)와 182개의 자격 증명을 복구했다.
- 위험 정보 노출: 모델의 최종 출력은 안전하더라도, 추론 과정 내부에 숨겨진 위험한 정보를 드러낸다.
- 보이지 않는 프롬프트 주입: 암호화 블록 내에 악성 페이로드를 삽입하여 공개된 에이전트 롤아웃을 오염시킬 수 있다.
연구진은 책임 있는 공개 절차를 거쳤으며, 클라이언트 측 추론 보안을 위한 구체적인 암호화 및 시스템 수준 완화책을 제안했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.