AI Briefing

Netflix의 Cassandra 데이터 이동 기술의 진화

·2026.06.20 08:53

Netflix는 기존 Casspactor의 한계를 극복하기 위해 Cassandra에서 Iceberg로의 데이터 이동 방식을 재설계했다.

Netflix는 그동안 Casspactor라는 자체 커넥터를 통해 매일 약 1,200건, 총 3PB 규모의 데이터를 Apache Cassandra에서 Apache Iceberg로 이동시켜 왔다. 하지만 데이터 규모가 커짐에 따라 기존 방식은 심각한 기술적 한계에 직면했다.

주요 문제점은 다음과 같다:

  • 취약한 메타데이터 의존성: 여러 독립적인 시스템에서 메타데이터를 수집하는 방식은 실제 백업 데이터와 동기화가 맞지 않는 문제를 야기했다.
  • 데이터 모델 인식 부재: Casspactor는 원시(Raw) 테이블만 이동할 수 있어, Key Value나 Time Series 같은 고수준 데이터 추상화 모델을 처리할 때 추가적인 후처리 작업이 필요했다.
  • 리소스 및 성능 문제: 대규모 파티션 처리 시 Out-of-Memory(OOM) 오류가 발생하거나, 중간 테이블 생성으로 인한 스토리지 낭비가 발생했다.

Netflix는 이를 해결하기 위해 메타데이터를 외부 시스템이 아닌 Amazon S3 백업 파일에서 직접 읽어오는 '단일 진실 공급원(Single Source of Truth)' 방식을 도입하여 아키텍처를 개선하고자 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.