AI Briefing

데이터 분석 라이브러리 개발기 (1)

·2020.11.27 09:00

데브시스터즈가 PySpark SQL 사용 편의성을 높이기 위해 **DevPlay Analytics** 라이브러리를 개발하게 된 배경과 문제점을 소개한다.

데브시스터즈의 DevPlay Data Platform 팀은 제품 로그와 데이터가 원활하게 흐르도록 엔지니어링을 담당한다. 이번 글에서는 데이터 분석가가 PySpark SQL을 더 편리하게 사용할 수 있도록 돕는 DevPlay Analytics 라이브러리 개발 과정을 소개한다.

현재 DevPlay는 Apache Spark를 통해 빅데이터를 병렬 분산 처리하며, 분석가는 AWS S3에 적재된 데이터를 Jupyterhub에서 분석하고 Apache Airflow로 워크플로우를 관리한다.

하지만 플랫폼 규모가 커지면서 다음과 같은 문제점들이 발생했다:

  • 복잡한 데이터 경로: 게임과 데이터 계층에 따라 수많은 S3 경로를 일일이 입력해야 하는 불편함.
  • 설정값 관리: 데이터 접근을 위한 credential 및 설정값 관리의 어려움.
  • 환경 간 불일치: Jupyter NotebookAirflow 배치 환경 간의 유틸 함수 공유 불가로 인한 개발 사이클 지연.
  • 낮은 분석가 친화도: PySpark 자체의 사용성 문제.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.