AI Briefing

Kubernetes용 자율 SRE 에이전트를 구축한 방법

·2026.08.06 01:35

핵심 내용

LangChain이 Kubernetes 장애를 진단하고 수정을 제안하는 자율 SRE 에이전트를 구축했다.

자세히 보기

LangChain은 Kubernetes 클러스터의 장애를 자동으로 분류하고 대응 시간을 줄이기 위해 자율 SRE 에이전트를 구축했다. 에이전트는 클러스터 상태를 점검하고 문제를 진단하며, 필요한 경우 수정안을 제안하지만 실제 변경은 항상 사람의 승인을 거치도록 설계됐다.

Kubernetes는 Pod 상태, 재시작 횟수, HPA 상태, 노드 조건, 경고 이벤트, 배포 준비 상태 등 방대한 신호를 내보내지만 이를 종합해주지는 않는다. 에이전트는 다음과 같은 작업을 수행한다.

  • 사전 모니터링: 스케줄러가 일정 주기로 Kubernetes Python client를 사용해 클러스터 상태를 수집하고, Claude Haiku를 한 번 호출해 심각도별 건강 보고서를 Slack에 전달한다.
  • 온디맨드 조사: 문제가 발생하면 pod-inspector, scaling-analyzer, performance-analyzer, log-analyzer, security-auditor, reliability-auditor 등 전문 하위 에이전트가 병렬로 조사한 뒤 우선순위가 정해진 보고서를 만든다.
  • 안전한 변경 관리: 에이전트는 클러스터 전체를 읽을 수 있지만 스스로 변경할 수는 없다. 배포 확장, 롤아웃 재시작, HPA 패치 같은 쓰기 작업은 change-executor 하위 에이전트에 모이고, 모든 도구 호출은 HITL(human-in-the-loop) 승인을 거친다.

구현에는 LangGraph 위에서 동작하는 Deep Agents를 사용해 계획 수립, 하위 에이전트, HITL 인터럽트를 기본 기능으로 활용했다. 하나의 거대한 프롬프트 대신 역할이 좁은 전문 에이전트를 구성해 병렬성과 컨텍스트 효율을 높였고, 추론이 필요한 오케스트레이터에는 Claude Sonnet을, 읽기 전용 작업과 정기 점검에는 Claude Haiku를 배정했다.

정기 점검에서는 전체 오케스트레이터를 실행하지 않고 일반 Python 코드로 상태를 수집한 뒤 Haiku를 한 번만 호출한다. 그 결과 점검 1회당 비용을 95~99% 절감하면서도 장애 탐지 성능은 유지하고, 복잡한 조사는 온디맨드 방식으로 처리한다. 읽기 작업은 자율화하되 쓰기 작업은 Slack에서 사람이 승인하도록 하고, 클러스터 RBAC로도 같은 원칙을 강제했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.