AI Briefing

카카오 KHP, 100개 이상 클러스터 위한 메트릭·로그 통합 모니터링 체계 공개

·2022.12.19 00:00

핵심 내용

Druid와 Kafka를 활용해 100개 이상 클러스터의 메트릭과 로그를 실시간 수집 및 시각화하는 체계를 구축했다.

1 / 9

자세히 보기

카카오는 100개 이상의 클러스터를 관리하기 위해 오픈소스와 자체 개발 기능을 결합한 KHP 모니터링 및 알림 체계를 운영 중이다. 이 체계는 기존 메트릭 중심의 모니터링 한계를 보완하기 위해 메트릭과 로그를 모두 지속적으로 수집하고 분석하는 이중 구조를 채택했다.

메트릭 수집 및 아키텍처

KHP는 호스트 단위 지표부터 HDFS, HBase 등 서비스 단위 지표까지 다양한 지표를 실시간으로 수집한다. 최종 저장소로는 확장성과 시계열 처리 성능이 뛰어난 Apache Druid를 선정했으며, 데이터 수집과 정제를 위해 자체 개발한 KHP Agent를 각 서버에 설치했다.

기존 오픈소스인 Jolokia나 Metricbeat는 누적값 보정이나 Druid용 포맷 가공 등 KHP의 요구사항을 충족하지 못해 자체 구현을 선택했다. KHP Agent는 CPU 사용률 같은 절댓값과 HDFS numOps 같은 누적값을 구분하여 보정하고, 이를 Kafka를 통해 Druid의 실시간 파이프라인으로 전송한다.

시각화 및 로그 처리

시각화 도구로는 Grafana를 기본으로 사용하며, Drill-down이 필요한 경우 Druid 기반의 Turnilo를 활용해 즉각적인 데이터 탐색을 지원한다. 로그 처리에는 Elasticsearch, Logstash, Kibana(ELK 스택)를 도입했다.

특히 로그 처리 시 Filebeat가 수집한 데이터를 Kafka를 거쳐 Elasticsearch로 전송하는 구조를 채택했다. 이는 Kafka의 offset 관리 기능을 통해 로그 유실 없이 데이터를 안정적으로 적재하고, 대용량 로그 환경에서도 검색 지연을 최소화하기 위함이다. 또한 HBase나 HDFS 특유의 로그 패턴을 분석하기 위해 GC 로그 전용 대시보드를 구축하여 애플리케이션 성능 저하의 원인을 정밀하게 추적할 수 있도록 지원한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.