DEAデータストアの管理
医療系スタートアップは、患者データをAmazon S3上のデータレイクにParquet形式で管理しています。
GDPRおよびHIPAAのコンプライアンス要件により、以下の操作を効率的に行う必要があります。
・特定患者のレコードをファイルレベルではなく行レベルで削除する(忘れられる権利)
・既存レコードへのフィールド更新・追記(医療記録の修正)
・過去の任意時点のデータにアクセスするタイムトラベルクエリ
現在はAWS GlueカタログとAmazon Athenaを使用しています。
この要件を満たすために採用すべきテーブルフォーマットはどれですか?
A既存のParquetファイルを維持し、削除対象レコードをフィルタするAthena VIEWを作成してGDPR要件に対応する
VIEWによるフィルタではS3上の実データは削除されず、GDPRの「忘れられる権利」を技術的に満たしません。
BAmazon Redshift Spectrumに移行し、EXTERNAL TABLEに対してDELETE文を実行してコンプライアンス要件を満たす
Redshift SpectrumではEXTERNAL TABLEに対するDELETE操作がサポートされません。
CApache IcebergテーブルフォーマットをAWS Glueカタログに登録し、MERGE INTO・行レベルDELETE・スナップショットを活用したタイムトラベルクエリで要件を満たす
✓ 正解
Apache IcebergはS3上でACIDトランザクション・行レベルDELETE・MERGE INTO・タイムトラベルをサポートするオープンテーブルフォーマットです。AWS GlueおよびAthenaとネイティブ統合されており、既存のデータレイク構成を大きく変えずに採用できます。
DデータをAmazon DynamoDBに移行してTTL機能で自動削除を実現し、Amazon Athena Federatedクエリで分析する
DynamoDBへの移行は大規模な分析用途に不向きで、TTLは指定日時での自動削除に限定され個別レコードの即時削除には適しません。
解説
正解:
Apache IcebergテーブルフォーマットをAWS Glueカタログに登録し、MERGE INTO・行レベルDELETE・スナップショットを活用したタイムトラベルクエリで要件を満たす。
Apache IcebergはS3上でACIDトランザクション・行レベルDELETE・MERGE INTO・タイムトラベルをサポートするオープンテーブルフォーマットです。AWS GlueおよびAthenaとネイティブ統合されており、既存のデータレイク構成を大きく変えずに採用できます。
選択肢Aは、VIEWによるフィルタではS3上の実データは削除されず、GDPRの「忘れられる権利」を技術的に満たしません。
選択肢Bは、Redshift SpectrumではEXTERNAL TABLEに対するDELETE操作がサポートされません。
選択肢Dは、DynamoDBへの移行は大規模な分析用途に不向きで、TTLは指定日時での自動削除に限定され個別レコードの即時削除には適しません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →