GitHub, 8월 가용성 보고서 공개… Azure 이전 및 아키텍처 개선 진행 중
핵심 내용
GitHub가 8월 가용성 보고서를 통해 Azure 이전 현황과 Actions, Copilot 등 주요 서비스의 장애 원인 및 개선 계획을 공개했다.
자세히 보기
GitHub가 2026년 8월 가용성 보고서를 공개하며, Azure로의 인프라 이전과 아키텍처 개선 현황을 상세히 밝혔다. 현재 읽기 트래픽의 Azure 전환율은 마이그레이션 서비스 60.4%, 모놀리스 64.3%, Git 읽기 54% 수준이다. 인증 코어를 분리해 초당 약 100만 쿼리를 감소시켰으며, 쿼리 위생 개선을 통해 초당 12만 쿼리와 시간당 5.9만 초의 낭비를 제거했다.
주요 장애 및 원인 분석
8월에는 GitHub Actions, Issues/PR, Copilot 등 핵심 서비스에서 여러 차례 장애가 발생했다.
- GitHub Actions (8/6, 약 10시간 42분): 최소 74개 조직에 영향을 미쳤다. Routine deployment 과정에서 pod 교체로 한 사이트 용량이 일시 감소했고, 트래픽 이동으로 나머지 사이트가 한계를 초과했다. Service mesh sidecar의 CPU throttling과 OOM restart가 연쇄 오류를 유발했으며, job-assignment path의 latent bug로 인해 runner가 무한 retry에 빠져 복구 지연을 초래했다.
- Issues/PR 및 광범위 서비스 (8/17, 약 6시간 44분): 약 29K 조직, 총 4.8M 건의 요청에 영향을 미쳤다. 트래픽 급증으로 데이터센터 로드밸런서 한계를 초과했고, Service-mesh sidecar가 concurrency limit 도달 후 scale-up에 실패했다. Client retry bug가 내부 인증 엔드포인트 트래픽을 급증시켜 Copilot Token Service 복구까지 지연시키는 연쇄 효과를 냈다.
- Copilot Cloud Agent (8/20, 약 10시간 40분): 최소 54개 조직에 영향을 미쳤다. DB region provider outage로 인해 status/results 업데이트가 최대 60~90분 지연되었다. 작업 자체는 정상 실행되었으나, DB 지연으로 streaming processor 백로그가 발생했다.
- GitHub Actions (8/26, 약 2시간 53분): 386개 조직에 일부 영향을 미쳤다. Actions 성장 대비 shared infrastructure 미비로 event burst가 발생해 DB primary가 saturated 되었다. 자동 circuit breaker 부재로 수동 throttling이 필요했다.
- Copilot Kimi K3 모델 (8/27, 약 2시간 50분): Upstream model provider의 serving degradation으로 Kimi K3 요청의 63.3%가 실패했다. 해당 모델 사용자에게만 영향을 미쳤으며, 다른 모델이나 Auto 설정은 정상 작동했다.
개선 및 대응 계획
GitHub는 이러한 장애를 방지하기 위해 Service mesh ingress와 actions 서비스의 headroom 확보, autoscaling 활성화 등을 추진 중이다. Deployment 중 용량 감소 방지 로직을 강화하고, saturation 및 database-proxy 모니터링을 개선한다. 또한 client retry 동작 수정, LB 용량 모니터링 강화, regional failover 강화 등을 통해 시스템 안정성을 높일 계획이다. Copilot의 경우 failover 지연을 유발하는 storage config를 제거하고 latency에 resilient한 streaming 구조로 전환한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.