AI Briefing

Claude Code, 서브 에이전트 재개 시 캐시 미스 및 과금 이슈

Quota draining? Claude Code re-bills a finished sub-agent's whole context on a follow-up

·2026.09.16 21:23

핵심 내용

Claude Code가 서브 에이전트 종료 후 후속 요청 시 프롬프트 캐시를 재사용하지 않아 거의 전체 컨텍스트를 재작성하며 과금하는 문제가 보고됐다.

자세히 보기

Claude Code에서 서브 에이전트 종료 후 1시간 캐시 윈도우 내 후속 요청을 보낼 때, 기존 컨텍스트를 캐시에서 읽지 않고 **거의 전체 컨텍스트를 재작성(cache write)**하여 사용량이 급증하는 문제가 확인됐다.

문제 현상 및 원인

서브 에이전트 종료 후 약 50분 뒤 후속 요청 시 각각 243K, 399K 토큰이 캐시에 쓰이는 반면, 에이전트 작업 중 전송한 메시지는 2K~4K 토큰 비용만 발생한다. 이는 API 응답의 messages_changed 표시와 관련 있으며, 특히 Claude Code 2.1.273 버전에서는 재개된 요청 크기가 'thinking' 토큰만큼 감소하여 thinking이 전송되지 않은 것이 캐시 미스의 원인으로 지목된다. 문서상으로는 이전 tool calls와 reasoning을 유지하고 캐시를 재사용해야 하지만 실제 동작과 불일치한다.

비용 영향 및 대응책

재개된 서브 에이전트의 첫 메시지는 에이전트 컨텍스트 전체만큼의 캐시 쓰기 비용이 발생하여 주간 사용량 한도 소모의 주요 원인이 된다. Anthropic은 정확한 가중치를 공개하지 않았으나, 유휴 세션 재개 시 thinking을 지워 비용을 줄이려던 과거 변경이 롤백된 사례와 유사한 형태다.

개발자는 다음과 같은 대응책을 고려할 수 있다:

  • 에이전트 작업 중 메시지 전송 (저비용)
  • 종료된 에이전트에는 브리핑을 가진 새 에이전트 사용 권장
  • 서브 에이전트 컨텍스트가 불필요한 작업은 메인 세션에서 처리

자체 진단 방법

~/.claude/projects/<project>/<session>/subagents/agent-<id>.jsonl 경로의 로그에서 cache_creation_input_tokens(유료)와 cache_read_input_tokens(거의 무료)를 비교하여 문제를 진단할 수 있다. 큰 쓰기량과 작은 읽기량, messages_changed 조합이 나타나면 해당 이슈가 발생한 것이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.