AI Briefing

최근 Claude Code 품질 보고에 대한 업데이트

Anthropic이 Claude Code 품질 저하의 원인을 3가지 변경 사항으로 특정하고 수정했다고 밝혔다.

Anthropic은 최근 일부 사용자에게 Claude 응답 품질이 나빠졌다는 보고를 조사해, Claude Code, Claude Agent SDK, Claude Cowork에 걸친 3가지 별도 변경이 원인이었음을 확인했다고 밝혔다. API와 추론 인프라는 영향이 없었고, 세 이슈는 모두 4월 20일(v2.1.116) 기준으로 수정됐다.

주요 원인은 다음과 같다.

  • 기본 reasoning effort 변경: 3월 4일 Claude Code의 기본값을 high에서 medium으로 낮췄다가, 지연 시간 문제를 줄이려던 선택이 품질 저하로 이어져 4월 7일 되돌렸다. 이 영향은 Sonnet 4.6, Opus 4.6에 걸쳤다.
  • 세션 thinking 캐시 제거 버그: 3월 26일 1시간 이상 idle 상태였던 세션의 오래된 thinking을 지우는 최적화를 넣었지만, 버그 때문에 이후 세션 내내 매 턴마다 생각이 계속 지워졌다. 그 결과 기억 상실, 반복, 이상한 도구 선택처럼 보였고, 4월 10일 수정됐다. 이것도 Sonnet 4.6, Opus 4.6에 영향을 줬다.
  • verbosity 축소 시스템 프롬프트 변경: 4월 16일 넣은 짧게 답하라는 프롬프트가 다른 변경과 결합돼 코딩 품질을 떨어뜨렸고, 4월 20일 되돌렸다. 이 영향은 Sonnet 4.6, Opus 4.6, Opus 4.7에 걸쳤다.

Anthropic은 이 세 변경이 서로 다른 트래픽에 서로 다른 시점에 영향을 줘, 전체적으로는 광범위하지만 들쭉날쭉한 성능 저하처럼 보였다고 설명했다. 또한 내부 사용량과 초기 eval로는 재현이 어려웠고, 특히 두 번째 버그는 여러 리뷰·테스트·dogfooding을 통과했지만 결국 코드 리뷰에 더 많은 저장소 컨텍스트를 넣는 개선을 추진하게 됐다.

향후에는 다음을 강화하겠다고 밝혔다.

  • 내부 직원의 public build 사용 확대
  • 내부 Code Review 도구 개선 및 고객 배포
  • 시스템 프롬프트 변경에 대한 더 넓은 모델별 eval, ablation, soak period, 점진적 rollout 적용
  • 모델별 변경을 해당 모델에만 제한하도록 CLAUDE.md 가이드 강화

마지막으로 Anthropic은 사용자가 /feedback으로 구체적 사례를 제보해 준 덕분에 문제를 찾아 수정할 수 있었다고 밝히며, 모든 구독자 사용량 제한을 재설정했다고 덧붙였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.