DEAデータの取り込みと変換
あるeコマース企業は、AWS Glue ETLジョブを使用してAmazon S3上のデータレイクに顧客の購買履歴データを蓄積しています。以下の新たな要件が追加されました。
・プライバシー保護法への対応として、特定顧客のデータをレコード単位で削除できる必要がある
・過去の任意の時点のデータスナップショットをタイムトラベルクエリで参照できるようにしたい
・S3上のファイルに対してACIDトランザクション(原子性・一貫性・独立性・耐久性)を保証したい
これらの要件を最も効率的に満たすアプローチはどれですか?
A対象レコードを除外した新しいParquetファイルを生成するAWS Lambda関数を実装し、元ファイルを上書きする
LambdaによるParquetファイルの再生成はACIDを保証できず、並行処理時の競合状態が発生するリスクがあります。
BAWS Glue ETLジョブでApache Icebergテーブル形式を使用し、S3データレイクをトランザクション対応にする
✓ 正解
Apache IcebergはS3上でACIDトランザクション、レコードレベルのUPSERT/DELETE、スナップショットベースのタイムトラベルクエリをサポートするオープンテーブル形式であり、AWS GlueはIcebergをネイティブサポートしています。GDPRなどのプライバシー法対応(忘れられる権利)に最適です。
CAmazon Redshift Spectrumで外部テーブルを作成し、S3データに対してDELETE文を実行する
Redshift Spectrumは外部テーブルへのSELECTは可能ですが、S3上のファイルに直接DELETE文を実行してACIDを保証する機能はありません。
DAWS Glue DataBrewでカスタム変換レシピを作成してデータを定期的に再生成する
Glue DataBrewはデータクリーニング・変換ツールであり、ACIDトランザクションやタイムトラベルクエリの機能は持ちません。
解説
Apache IcebergはS3上でACIDトランザクション、レコードレベルのUPSERT/DELETE、スナップショットベースのタイムトラベルクエリをサポートするオープンテーブル形式であり、AWS GlueはIcebergをネイティブサポートしています。GDPRなどのプライバシー法対応(忘れられる権利)に最適です。
選択肢AのLambdaによるParquetファイルの再生成はACIDを保証できず、並行処理時の競合状態が発生するリスクがあります。
選択肢CのRedshift Spectrumは外部テーブルへのSELECTは可能ですが、S3上のファイルに直接DELETE文を実行してACIDを保証する機能はありません。
選択肢DのGlue DataBrewはデータクリーニング・変換ツールであり、ACIDトランザクションやタイムトラベルクエリの機能は持ちません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →