구축 사례: 흩어진 운영 데이터를 하나로 통합한 kt cloud 운영 데이터 플랫폼 Deck 구축기
·2026.08.06 15:04
핵심 내용
kt cloud가 분산된 운영 데이터를 통합하는 레이크하우스 플랫폼 Deck을 구축했다.
1 / 2
자세히 보기
kt cloud는 로그, 지표, 이벤트, 사용량 등 시스템별로 흩어진 운영 데이터를 하나의 기준으로 통합하기 위해 데이터 플랫폼 Deck을 구축했다. 데이터 수집과 가공을 반복하는 비효율을 줄이고, 운영·개발·사업 조직이 동일한 데이터를 바탕으로 분석과 의사결정을 내리는 것이 목표다.
Deck은 정형·반정형·비정형 데이터를 다루면서도 과금과 운영 분석에 필요한 신뢰성을 확보하기 위해 Data Lakehouse 아키텍처를 채택했다. 레이크의 유연성에 ACID 트랜잭션과 스키마 관리를 결합하고, 순수 오픈소스 기반 구축과 Object Storage를 단일 기준 저장소(SSOT)로 삼는 두 가지 원칙을 적용했다.
플랫폼은 목적별 레이어로 구성된다.
- 수집: Kafka와 Vector로 다양한 운영 데이터를 안정적으로 수집하고 전처리한다.
- 저장: Object Storage에 원본을 한 번만 저장해 데이터 중복과 관리 복잡도를 줄인다.
- 쿼리: Trino로 데이터를 별도 적재하지 않고 Object Storage를 직접 SQL 조회한다.
- 처리: Airflow가 배치 파이프라인의 일정·의존성·재처리를 관리하고, Spark가 대용량 정제와 집계를 담당한다.
- 서빙: StarRocks가 실시간 Upsert와 고속 조합을 지원하는 저지연 OLAP 환경을 제공한다.
- 표현: Superset으로 라이선스 비용과 벤더 종속성을 줄인 오픈소스 BI 환경을 구성한다.
각 레이어를 독립적으로 설계한 이유는 하나의 엔진에 수집부터 서빙까지 집중될 때 발생하는 병목을 피하기 위해서다. 공통 저장소를 기준으로 삼아 서비스와 데이터 규모가 커져도 레이어별로 확장할 수 있도록 했다. 대표 적용 사례로는 빌링 파이프라인이 제시된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.