AI Briefing

Anthropic의 Claude Code 장애 postmortem: 2025년 4월 23일

·2026.04.24 07:01

Claude Code 품질 저하를 부른 3가지 원인과 수정 내역 공개

지난 한 달간 보고된 Claude 응답 품질 저하의 원인을 Anthropic이 공식 postmortem으로 공개했다. 영향 범위는 Claude Code, Claude Agent SDK, Claude Cowork였고, API 자체에는 영향이 없었다. 모든 문제는 2025년 4월 20일(v2.1.116) 기준으로 해결됐다.

세 가지 변경이 서로 다른 방식으로 문제를 만들었다.

  • 3월 4일: Claude Code의 기본 reasoning effort를 high에서 medium으로 낮췄다가, 느린 응답은 줄었지만 품질 저하가 확인돼 4월 7일 원복했다.
  • 3월 26일: 1시간 이상 유휴 세션을 재개할 때 이전 thinking 기록을 정리하는 캐싱 최적화가 버그로 인해 이후 모든 턴마다 반복 실행됐다. 이로 인해 Claude가 과거 맥락을 잃고, 반복 응답과 비정상적 도구 선택, 잦은 cache miss, 예상보다 빠른 사용량 소진이 발생했다. 이 문제는 4월 10일 수정됐다.
  • 4월 16일: Opus 4.7의 장황함을 줄이려는 목적으로 도구 호출 사이 25단어 이내, 최종 응답 100단어 이내라는 시스템 프롬프트가 추가됐다. 내부 테스트에서는 드러나지 않았지만 실제 코딩 품질을 떨어뜨려 4월 20일 제거됐다.

문제 발견이 늦어진 이유도 공개했다. 변경이 서로 다른 시점과 트래픽 범위에 적용돼 원인이 분산돼 보였고, 내부 테스트 환경과 실제 사용자 환경의 차이 때문에 재현이 어려웠다. 기존 eval suite도 충분히 넓지 않아, 시스템 프롬프트 변경의 영향은 더 넓은 평가를 돌린 뒤에야 3% 성능 하락으로 확인됐다.

재발 방지책으로는:

  • 내부 직원의 공개 빌드 사용 의무화
  • 시스템 프롬프트 변경에 대한 모델별 평가, ablation, 점진 배포, 충분한 soak period 적용
  • 코드리뷰가 참조할 수 있는 저장소 범위 확대
  • 사용자 소통 채널 @ClaudeDevs 신설

Anthropic은 모델을 의도적으로 저하시킨 적은 없다고 설명했고, 구독자들의 사용량 한도는 초기화했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.