AI Briefing

상용 LLM API에서 추론 트레이스(Reasoning Traces) 탈취하기

·2026.08.12 09:00

핵심 내용

연구진이 상용 LLM API의 암호화된 추론 트레이스를 재현해 모델의 숨겨진 추론 과정을 복구하는 데 성공했다.

자세히 보기

Anthropic, OpenAI, Google 등 주요 기업의 독점 모델은 암호화된 Chain-of-Thought(CoT) 블록을 클라이언트에 반환한다. 이 트레이스는 세션, 사용자, 모델을 가로질러 재현(Replay)될 수 있는 구조를 가지고 있다.

연구진은 프런티어 모델에서 생성된 트레이스를 추출한 뒤, 이를 성능이 낮은 **하위 모델(Sibling model)**에 재현하는 방식을 사용했다. 이후 하위 모델을 **탈옥(Jailbreak)**하여, 원래의 강력한 모델이 가졌던 숨겨진 추론 과정을 평문으로 복구했다.

이 방식은 다음과 같은 특징을 가진다:

  • 강력한 모델을 직접 공격하지 않아 안티 디스틸레이션(Anti-distillation) 방어 기제를 우회함.
  • 복구된 추론 내용은 API가 보고하는 숨겨진 생각 토큰(Thinking tokens) 수와 밀접하게 일치함.
  • 복구된 데이터에는 실제 기밀 및 민감한 정보가 포함될 수 있음.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.