Amazon S3 Tables, Apache Iceberg V3의 모든 데이터 타입 지원
핵심 내용
Amazon S3 Tables가 Apache Iceberg V3의 모든 데이터 타입과 기능을 지원한다.
자세히 보기
Amazon S3 Tables가 Apache Iceberg V3 사양의 모든 데이터 타입을 지원한다. 사용자는 새 V3 테이블을 생성하거나 기존 V2 테이블을 제자리에서 업그레이드할 수 있다. 이번 업데이트는 V2의 위치 기반 삭제 파일로 인한 느린 쿼리 성능과 반구조화 JSON 문자열 파싱 필요성 같은 한계를 해결하기 위해 삭제 벡터(deletion vectors), 행 계보(row lineage), 그리고 variant, 나노초 타임스탬프, geometry, geography, unknown 같은 새 데이터 타입을 네이티브로 지원한다.
주요 V3 기능
새로운 기능은 스토리지 비용, 쿼리 지연 시간, 파이프라인 복잡성을 줄이는 것을 목표로 한다:
- 삭제 벡터: V2의 위치 기반 삭제 파일을 컴팩트한 바이너리 형식으로 대체하여 컴플라이언스 삭제 같은 작업에서 컴팩션 시간과 삭제 파일 오버헤드를 크게 줄인다.
- 행 계보: 각 레코드에
_row_id와_last_updated_sequence_number를 자동으로 추가하여, 다운스트림 파이프라인이 전체 테이블을 스캔하지 않고 변경된 행을 쿼리할 수 있게 한다. - 새 데이터 타입: 반구조화, 지리 공간, 나노초 정밀도 데이터를 네이티브로 저장할 수 있게 한다. variant 타입은 반구조화 데이터를 컬럼형 형식으로 저장하며, 파일 프루닝에 통계를 사용해 JSON 문자열 파싱보다 I/O를 줄인다.
구현 및 호환성
사용자는 데이터를 다시 쓰지 않고 ALTER TABLE ... SET TBLPROPERTIES ('format-version' = '3')를 사용해 기존 테이블을 원자적으로 업그레이드할 수 있다. 이는 일방향 작업이며, Apache Iceberg 사양은 V3에서 V2로의 다운그레이드를 지원하지 않는다. 기존 V2 리더는 완전한 V3 채택 전까지 업그레이드된 테이블에서 계속 작동한다.
새로운 V3 데이터 타입을 사용하려면 엔진이 Apache Spark 4.0 이상, AWS Glue 6.0 이상, 또는 Amazon EMR release 8.1 이상 기반으로 구축되어야 한다. 이러한 데이터 타입은 Parquet 파일 형식을 사용하는 테이블에서만 지원된다. 또한 variant, geometry, geography, 나노초 타임스탬프 타입의 컬럼은 컴팩션을 위한 테이블 정렬 순서에 포함할 수 없다.
가용성
Amazon S3 Tables의 모든 Apache Iceberg V3 데이터 타입 지원은 S3 Tables가 지원되는 모든 AWS 리전에서 현재 사용 가능하다. V3 지원에 대한 추가 비용은 없으며, 표준 S3 Tables 가격이 적용된다. 사용자는 Amazon S3 콘솔, AWS CLI, 또는 Iceberg REST Catalog API를 지원하는 모든 엔진을 통해 V3 테이블을 생성할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.