TL;DR
- Aurora PostgreSQL에서 ETL 파이프라인이나 데이터 중복 없이 운영 데이터와 데이터 레이크의 Apache Iceberg·Parquet 데이터를 함께 조회할 수 있음.
- PostgreSQL 외부 테이블을 Amazon S3, Amazon S3 Tables, AWS Glue Data Catalog의 Iceberg 또는 Parquet 데이터에 연결하는 방식임.
- 외부 테이블 조회에는 PostgreSQL에 내장된 DuckDB의 고성능 쿼리 엔진이 사용되며, 기존 애플리케이션과 BI 도구는 같은 PostgreSQL 인터페이스를 이용함.
- AWS Glue Data Catalog를 통해 연동된 외부 Iceberg REST Catalog(IRC) 호환 카탈로그의 테이블도 데이터 이동이나 복제 없이 조회할 수 있음.
- 기능은 Aurora PostgreSQL 17.11, 18.6 이상에서 모든 AWS 상용 및 미국 GovCloud 리전에 추가 비용 없이 제공됨.
데이터 레이크 조회 지원
- 2026년 9월 30일부터 기존 PostgreSQL 애플리케이션과 도구를 사용해 운영 데이터와 Apache Iceberg 및 Parquet 형식으로 저장된 데이터 레이크 데이터를 직접 함께 조회할 수 있음.
- 애플리케이션은 더 나은 의사결정과 비즈니스 프로세스 자동화를 위해 데이터 레이크 데이터에 접근해야 하는 경우가 늘고 있음.
- 기존에는 데이터 레이크의 데이터를 Aurora로 복사하는 파이프라인이 필요한 경우가 많았으며, 스키마가 바뀔 때 비용과 엔지니어링 작업이 늘어나는 문제가 있었음.
- PostgreSQL 외부 테이블을 생성해 Amazon S3, Amazon S3 Tables 또는 AWS Glue Data Catalog에 있는 Iceberg·Parquet 데이터를 참조할 수 있음.
- 외부 테이블을 조회하면 Aurora가 PostgreSQL에 내장된
DuckDB의 고성능 쿼리 엔진으로 기초 Iceberg·Parquet 데이터에 대한 쿼리를 실행함. - 기존 애플리케이션과 비즈니스 인텔리전스(BI) 도구는 기존과 같은 PostgreSQL 인터페이스를 계속 사용함.
외부 카탈로그와 데이터 구체화
- AWS Glue Data Catalog를 통해 연동된 외부 Iceberg REST Catalog(IRC) 호환 카탈로그의 테이블도 데이터 이동이나 복제 없이 조회할 수 있음.
- 지연 시간에 민감한 워크로드에서는 표준 SQL 문을 사용해 Iceberg·Parquet 데이터를 기본 Aurora PostgreSQL 테이블로 구체화할 수 있으며, 이 과정에 ETL 파이프라인은 필요하지 않음.
제공 범위와 시작 방법
- 이 기능은 Aurora PostgreSQL 17.11, 18.6 이상에서 일반 제공되며, 모든 AWS 상용 리전과 미국 GovCloud 리전에서 추가 비용 없이 이용 가능함.
- 시작하려면 Amazon RDS 콘솔 또는 PostgreSQL 클라이언트를 사용하면 됨.
- 자세한 내용은 블로그 게시물 또는 문서를 참조하면 됨.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요