AI Briefing

GitHub 가용성 보고서: 2026년 3월

·2026.04.09 11:21

핵심 내용

3월 한 달간 GitHub는 네 차례 장애로 서비스 전반의 가용성이 떨어졌다.

자세히 보기

2026년 3월 GitHub는 총 4건의 장애를 겪으며 여러 서비스에서 성능 저하와 요청 실패가 발생했다.

3월 3일에는 1시간 10분 동안 github.com, GitHub API, GitHub Actions, Git operations, GitHub Copilot 등이 영향을 받았다. 피크 시 github.com 요청 실패율은 약 40%, GitHub API는 약 43%, HTTP 기반 Git operations는 약 6%, GitHub Copilot은 약 **21%**였고 SSH는 영향을 받지 않았다.

원인은 사용자 설정 캐싱 메커니즘에 대한 쓰기량 급증이었다. 캐시 만료·재계산·재기록이 전 사용자에게 동시에 발생하면서 복제 지연이 번졌고, GitHub는 문제 배포를 즉시 롤백해 대응했다.

이후 즉시 조치로는 다음을 진행했다.

  • 캐싱 메커니즘에 killswitch를 추가하고 모니터링을 강화
  • 해당 캐시를 전용 호스트로 이전해 영향 범위를 제한

3월 5일에는 GitHub Actions가 2시간 55분 동안 지연됐다. 워크플로 실행의 **95%**가 5분 안에 시작하지 못했고 평균 지연은 30분, **10%**는 인프라 오류로 실패했다.

원인은 Redis 인프라 업데이트 과정에서 잘못된 설정이 로드 밸런서에 들어가 내부 트래픽이 엉뚱한 호스트로 향한 것이다. GitHub는 로드 밸런서를 수정해 복구했고, 이후 관련 변경을 모두 되돌리고 이 영역의 변경을 동결했다.

추가로 자동화 개선과 잘못된 설정의 전파 차단, 로드 밸런서 사전 탐지 알림 강화, Actions의 Redis client 설정 조정도 예고했다.

3월 19일과 3월 20일에는 Copilot Coding Agent 서비스가 불안정해 새 세션 시작과 기존 세션 조회가 막혔다. 첫 번째 장애는 평균 오류율이 약 **53%**였고 최대 **93%**까지 올랐으며, 두 번째는 평균 99%, 최대 **100%**에 달했고 재시도 증폭도 심했다.

두 장애는 모두 백업 datastore에 연결하지 못하게 만든 시스템 인증 문제에서 비롯됐다. 영향받은 credential을 회전해 복구했고, 두 번째 장애는 첫 번째 조치가 완전하지 않았기 때문에 재발했다.

3월 24일에는 Microsoft Teams Integration과 Teams Copilot Integration이 GitHub 이벤트 알림을 Teams로 전달하지 못했다. 평균 오류율은 37.4%, 최대는 **90.1%**였고, 해당 기간 전체 통합 설치의 약 **19%**가 GitHub-to-Teams 알림을 받지 못했다.

원인은 상위 의존성의 장애로 발생한 HTTP 500과 connection reset이었다. GitHub는 관련 서비스 팀과 공조해 upstream 장애가 완화된 19:51 UTC에 문제를 해결했고, 이후 관측성 및 runbook 개선을 추진하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.