AI Briefing

SRE 업무에 AI 녹여내기 — 2편: Alert Adviser로 장애 원인 분석 자동화

·2026.08.24 14:42

핵심 내용

여기어때컴퍼니 SRE팀이 Grafana 알림을 AI가 분석해 장애 원인과 영향 범위를 자동 추적하는 Alert Adviser를 구축했다.

자세히 보기

여기어때컴퍼니 SRE팀은 온콜 담당자 외 QA, 타 서비스 팀 등이 장애 원인을 빠르게 파악할 수 있도록 Alert Adviser를 개발했다. 기존에는 알림 수신 후 담당자가 수동으로 대시보드와 로그를 확인해야 했으나, 이제는 AI가 1차 관측 데이터를 추적해 검증된 리포트를 제공한다.

Slack을 1차 인터페이스로 활용해 Grafana 알림을 실시간 수신한다. **MCP(Model Context Protocol)**를 통해 Mimir, Loki, Tempo 등 관측 데이터를 직접 조회하며, 분석 결과는 심각도, 추정 원인, 조치 가이드로 분리해 게시한다. 단일 EC2 인스턴스에서 Go 백엔드와 React 대시보드로 동작하며, 별도 인프라 확장 없이 기존 알림 인프라에 통합했다.

AI의 오판을 방지하기 위해 세 가지 통제 장치를 적용했다.

  • 근거 등급 강제: 백엔드 코드가 정규식으로 실측 수치와 추정 어투를 검증해 근거 등급을 확정한다.
  • 변경성 권한 차단: kubectl 등 시스템 변경 명령어는 분석 응답에서 제거하고 읽기 전용으로 제한한다.
  • 오판 패턴 검증 규칙: 과거 오류 사례를 바탕으로 가설 교차 검증 및 특정 지표(예: CPU 알림 시 I/O Wait 확인) 조회를 강제한다.

사내 문서 검색(RAG)은 데이터 정제 부담과 검색 품질 저하 문제로 자체 구축을 포기하고, 사내 공통플랫폼의 MCP 기반 RAG 도구를 활용했다. 이를 통해 조직 지식을 반영하되, 무관 문서 혼입을 줄이는 필터링 로직을 적용했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.