AI Briefing

8월 17일 장애와 앞으로의 과제

·2026.08.21 03:36

핵심 내용

GitHub는 8월 17일 발생한 7시간 47분간의 장애가 용량 부족 때문이었다고 밝히고 신뢰성 개선 계획을 발표했다.

자세히 보기

GitHub는 8월 17일 발생한 7시간 47분간의 장애로 인해 github.com, 인증, GitHub Actions, API, 풀 리퀘스트, 이슈, Copilot 등 핵심 서비스가 중단되었다고 밝혔다. 이는 8월 6일 Actions 장애에 이어 두 번째 주요 사고로, 트래픽 급증에 따라 Central US 데이터센터의 핵심 인프라가 스케일링에 실패하며 발생했다.

이번 장애는 코드나 설정 변경이 아닌 용량 부족이 근본 원인이었다. 4월 이후 월간 커밋 수가 14억 건에서 29억 건으로 증가하면서 시스템에 부담이 가중되었으나, 이는 장애를 정당화할 수 없는 이유라고 강조했다.

GitHub는 신뢰성 향상을 위해 300만 개 이상의 CPU 코어, 120PB의 고속 스토리지, 그리고 네트워크 용량을 추가했다. 현재 Azure는 플랫폼 부하의 약 58%, Git 작업의 절반을 처리하며, 5월 당시 12% 대비 크게 확대되었다. 또한 읽기 용량이 리더 수에 따라 선형적으로 확장되는 아키텍처를 도입하여 대규모 monorepo 지원에 나설 계획이다.

운영 관행의 한계를 인식하여 가용성, 테스트, 롤아웃, 관측성, 알림 시스템에 대한 투자를 강화했다. 특히 서비스 간 상호작용 시 리트라이 제한과 가변 타임아웃을 적용하여 리트라이 폭주와 연쇄 부하를 방지하는 조치를 즉시 시행했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.