AI Briefing

최근 3건의 장애 사후 분석

·2025.09.17 00:00

Anthropic은 3건의 인프라 버그가 Claude 응답 품질 저하를 일으켰다고 밝혔다.

8월 초부터 9월 초까지 세 개의 서로 다른 인프라 버그가 겹치면서 Claude의 응답 품질이 간헐적으로 떨어졌다. Anthropic은 수요, 시간대, 서버 부하 때문에 모델 품질을 낮춘 적은 없으며, 문제는 모두 인프라 버그에서 비롯됐다고 설명했다.

첫 번째 문제는 컨텍스트 윈도우 라우팅 오류였다. 8월 5일에 일부 Sonnet 4 요청이 실수로 1M token context window용 서버로 보내졌고, 초기 영향은 0.8% 수준이었다. 이후 8월 29일의 로드 밸런싱 변경으로 짧은 요청이 더 많이 잘못 라우팅되면서 영향이 커졌고, 8월 31일 최고 피해 시간에는 Sonnet 4 요청의 **16%**가 영향을 받았다. 라우팅은 sticky하게 동작해 한 번 잘못된 서버로 가면 이후 후속 요청도 같은 경로로 이어질 가능성이 컸다.

두 번째 문제는 output corruption이었다. 8월 25일 Claude API의 TPU 서버에 잘못된 설정이 배포되면서 token 생성 중 오류가 발생했고, 드물게 영어 프롬프트에 태국어·중국어 문자가 섞이거나 코드에서 명백한 syntax error가 나타났다. 이 문제는 Opus 4.1, Opus 4, Sonnet 4에 걸쳐 나타났으며, Anthropic은 9월 2일 변경을 롤백하고 배포 과정에 예상치 못한 문자 출력 탐지 테스트를 추가했다.

세 번째 문제는 approximate top-k XLA:TPU miscompilation이었다. 8월 25일 token 선택 로직을 개선하는 코드를 배포했는데, 이것이 XLA:TPU 컴파일러의 잠복 버그를 건드렸다. 이 버그는 Haiku 3.5 요청에서 확인됐고, 일부 Sonnet 4Opus 3에도 영향을 줬을 가능성이 있다고 봤다. Anthropic은 exact top-k로 전환하고 일부 연산을 fp32 정밀도로 표준화했으며, 별도로 XLA:TPU 팀과 컴파일러 수정도 진행 중이다.

문제의 핵심은 단일 원인이 아니라, 서로 다른 버그가 겹치며 증상을 섞어 보이게 만들었다는 점이다. Anthropic은 TPUs, GPUs, Trainium 등 여러 하드웨어 플랫폼과 Bedrock, Vertex AI, 자체 API를 함께 운영하는 구조에서, 플랫폼별 구현이 동일한 품질을 내야 한다는 전제 아래 검증이 매우 어렵다고 밝혔다. 특히 모델은 isolated mistake에는 잘 회복하는 경우가 많아 기존 평가만으로는 품질 저하를 충분히 잡아내지 못했다.

가시성 문제도 컸다. 내부 privacy 및 security 제약 때문에, 사용자가 직접 신고하지 않은 대화는 엔지니어가 쉽게 열람할 수 없어 재현과 진단이 늦어졌다. Anthropic은 앞으로 더 민감한 evaluations, 실제 production 시스템에서의 continuous quality evaluation, 그리고 privacy를 해치지 않는 빠른 디버깅 도구를 강화하겠다고 밝혔다. 또한 사용자 피드백, /bug 명령, 앱의 thumbs down, 그리고 [email protected]으로의 제보가 여전히 중요하다고 강조했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.