無限ノック › DEA 練習問題一覧 › 問題
DEAデータストアの管理

ある金融サービス企業は、Amazon S3にParquet形式で数百TBの取引データを蓄積するデータレイクを運用しています。GDPRへの対応として特定顧客のレコードを削除・更新する必要があり、またデータパイプラインの障害時に一貫性を保証するACIDトランザクション(原子性・一貫性・独立性・耐久性)が求められています。さらに、コンプライアンス監査のために更新前の任意時点のデータをクエリできる「タイムトラベル」機能も必要です。S3データレイクの構成を維持しながら、これらの要件をすべて満たす最適なアプローチはどれですか?

A
AWS GlueジョブでS3のParquetファイルを定期的に全量書き直し、削除・更新を適用する
AWS GlueジョブによるParquetファイル全量書き直しは大規模データで処理コスト・時間が膨大になり、ACIDもタイムトラベルも保証できません。
B
Apache IcebergテーブルフォーマットをAWS GlueおよびAmazon Athenaと組み合わせて使用し、S3上でACIDトランザクション・レコードレベルの更新削除・タイムトラベルを実現する
✓ 正解
Apache IcebergはS3上でACIDトランザクション・レコードレベルUPDATE/DELETE・スナップショットタイムトラベルを提供し、GlueとAthenaがネイティブサポートします。
C
データをAmazon DynamoDBに移行し、TTL(Time To Live)機能でデータ削除・整合性を管理する
Amazon DynamoDBはOLTP向けサービスであり、数百TBの分析データ用途に不適切です。TTLは期間後の自動削除で、任意レコードの即時削除要件とは異なります。
D
Amazon Redshiftにデータをロードし、MERGE文やDELETE文で更新・削除を行う
Amazon Redshiftへの移行はS3データレイクの柔軟性を失うアーキテクチャ変更であり、数百TBの全量移行コストも大きな課題となります。

解説

Apache IcebergはオープンテーブルフォーマットでありS3上でACIDトランザクション、レコードレベルのUPDATE/DELETE(Parquetファイル全体の書き直し不要)、スナップショットベースのタイムトラベルクエリを提供します。AWS GlueとAmazon AthenaはIcebergをネイティブサポートしており、既存のS3データレイク構成を維持したまま要件を満たせます。 選択肢Aは、大規模データでは処理コスト・時間が膨大になり、ACIDも保証されず、タイムトラベル機能も実現できないため不適切です。 選択肢Cは、Amazon DynamoDBはOLTP(オンライントランザクション処理:短時間の読み書きが多いワークロード)向けのサービスであり、数百TBの分析データの保存・クエリには不適切です。TTLは指定期間後の自動削除であり、任意レコードの即時削除要件とは異なります。 選択肢Dは、Amazon Redshiftへの移行はS3データレイクの柔軟性を失うアーキテクチャ変更を意味します。数百TBの大規模データの全量移行コストも課題となります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る