AI Briefing

Claude 성능저하 원인 공개

Anthropic admits to have made hosted models more stupid, proving the importance of open weight, local models

·2026.04.24 21:33

Anthropic이 Claude Code·SDK·Cowork의 성능 저하 원인 3가지를 공개했다.

Anthropic은 지난 한 달간 제기된 Claude 응답 품질 저하 보고를 조사한 결과, Claude Code, Claude Agent SDK, Claude Cowork에 각각 영향을 준 3개의 별도 변경이 원인이었다고 밝혔다. API와 inference layer는 영향이 없었다고 설명했다.

주요 원인은 다음과 같다.

  • Claude Code 기본 reasoning effort 변경: 3월 4일 기본값을 high에서 medium으로 낮췄다가, 더 높은 지능을 기본으로 두고 낮은 effort는 사용자가 선택하도록 하는 쪽이 낫다고 판단해 4월 7일 되돌렸다. 이 변경은 Sonnet 4.6, Opus 4.6에 영향을 줬다.
  • idle 세션의 thinking 삭제 버그: 3월 26일 1시간 이상 idle 된 세션에서 오래된 thinking을 지워 지연을 줄이려 했지만, 버그로 인해 그 이후 세션 내 모든 turn에서 계속 thinking이 삭제됐다. 그 결과 Claude가 기억을 잃은 듯 반복적이고 이상한 도구 선택을 보였고, 캐시 미스로 인해 usage limit이 더 빨리 소진되는 현상도 발생했다. 이 문제는 4월 10일 수정됐다.
  • verbosity 축소용 system prompt 변경: 4월 16일 응답 길이를 줄이는 프롬프트를 넣었지만, 다른 프롬프트 변경과 결합되며 코딩 품질을 떨어뜨렸고 4월 20일 되돌렸다. Sonnet 4.6, Opus 4.6, Opus 4.7에 영향을 줬다.

Anthropic은 이 세 변경이 서로 다른 시점과 트래픽에 걸쳐 발생해, 외부에서는 불규칙한 전반적 품질 저하처럼 보였다고 설명했다. 내부 사용량과 eval만으로는 즉시 재현되지 않아 원인 파악에 시간이 걸렸다고 덧붙였다.

재발 방지를 위해 Anthropic은 공개 빌드 사용 확대, 내부 Code Review 개선 및 고객 배포, system prompt 변경에 대한 더 엄격한 통제, 모델별 broad eval과 ablation, soak period 및 gradual rollout을 도입하겠다고 밝혔다. 또한 2026년 4월 23일 기준으로 모든 구독자 usage limit을 리셋한다고 발표했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.