無限ノック › DEA 練習問題一覧 › 問題
DEAデータストアの管理

ある EC サイトが Amazon S3 データレイクに Parquet 形式で取引データを保存しています。新たな要件として以下が追加されました。 ・複数の ETL ジョブからの同時書き込みに対して ACID トランザクション保証が必要 ・誤ったデータ更新を日時指定で元の状態に戻すタイムトラベル機能が必要 ・既存データを再書き込みせずにスキーマの列追加・型変更が必要 ・AWS Glue と Amazon Athena からシームレスにクエリできる必要がある 最も適切なアプローチはどれですか?

A
Amazon S3 に標準 Parquet ファイルを保存し、AWS Glue ジョブで更新のたびに全件再書き込みを行う
標準 Parquet+全件再書き込みは ACID 保証がなく、同時書き込みでデータ整合性が失われる可能性があります。
B
Amazon DynamoDB を使用し、タイムスタンプをソートキーとして過去データを管理する
DynamoDB はキー・バリュー型 NoSQL であり、タイムトラベルやスキーマエボリューションの概念がなく、大規模な Parquet ベースの分析ワークロードには不向きです。
C
Apache Iceberg テーブル形式を採用し、AWS Glue Data Catalog にテーブルを登録する
✓ 正解
Apache Iceberg は S3 上のデータに ACID トランザクション、タイムトラベル(スナップショット管理)、スキーマエボリューション(列追加・型変更)を提供するオープンテーブル形式です。AWS Glue Data Catalog への登録により、Glue ETL・Athena・EMR から統一的にアクセスできます。
D
Amazon Redshift で外部テーブルを定義して S3 データを参照する Redshift Spectrum を使用する
Redshift Spectrum は S3 を参照する外部テーブル機能ですが、ACID トランザクションや Iceberg が提供するテーブル管理機能は持ちません。

解説

Apache Iceberg は S3 上のデータに ACID トランザクション、タイムトラベル(スナップショット管理)、スキーマエボリューション(列追加・型変更)を提供するオープンテーブル形式です。AWS Glue Data Catalog への登録により、Glue ETL・Athena・EMR から統一的にアクセスできます。 選択肢Aの標準 Parquet+全件再書き込みは ACID 保証がなく、同時書き込みでデータ整合性が失われる可能性があります。 選択肢Bの DynamoDB はキー・バリュー型 NoSQL であり、タイムトラベルやスキーマエボリューションの概念がなく、大規模な Parquet ベースの分析ワークロードには不向きです。 選択肢Dの Redshift Spectrum は S3 を参照する外部テーブル機能ですが、ACID トランザクションや Iceberg が提供するテーブル管理機能は持ちません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る