LLM 암호화 추론 유출
Stealing Reasoning Traces from Proprietary LLM APIs
·2026.08.12 07:40
핵심 내용
연구진이 독점 LLM의 암호화된 추론 기록을 복호화해 유출하는 공격을 보고했다.
자세히 보기
연구진은 Anthropic, OpenAI, Google의 API가 클라이언트에 반환하는 암호화된 chain-of-thought 블록을 다른 세션·사용자·모델에서 재사용할 수 있다고 보고했다.
동일 모델군의 구성원이 같은 암호화 키를 사용한다는 점을 악용해, 상위 모델에서 생성된 추론 기록을 더 약한 모델에 주입하고 jailbreak하는 방식으로 원문 추론을 출력하게 만들었다. Claude Haiku 4.5가 가장 공격하기 쉬운 모델로 지목됐다.
논문은 모델의 추론 기록에 데이터 exfiltration 같은 악성 지시를 심은 뒤 다른 모델에 재주입하는 prompt injection 변형도 제시했다. 세 업체는 연구진의 제보를 받은 뒤 해당 공격이 재현되지 않도록 수정했다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.