無限ノック › DEA 練習問題一覧 › 問題
DEAデータストアの管理

ある小売企業のデータエンジニアリングチームは、Amazon S3 上のデータレイクに日次で数億件の注文データを蓄積しています。以下の要件を満たすオープンテーブルフォーマットの導入を検討しています。 ・注文キャンセルや返品処理に伴うデータの更新・削除を ACID トランザクションで安全に実行したい ・特定時点のデータを参照するタイムトラベルクエリを実現したい ・既存データを再書き込みせずにカラムを追加・変更するスキーマエボリューションに対応したい ・Amazon Athena と AWS Glue ETL ジョブでシームレスにクエリしたい 上記すべての要件を最も効果的に満たすテーブルフォーマットはどれですか?

A
Apache Parquet(スナップショット管理なしの列指向フォーマット)
Apache Parquet は高性能な列指向ストレージフォーマットですが、ACID トランザクションやタイムトラベル機能は持たず、単体でのテーブル管理機能がありません。
B
Apache Avro(行指向・スキーマ管理に優れたシリアライゼーションフォーマット)
Apache Avro は行指向のシリアライゼーションフォーマットであり、テーブルフォーマットではないため、ACID 保証やスナップショット管理機能を持ちません。
C
Apache Iceberg
✓ 正解
Apache Iceberg はオープンテーブルフォーマットとして、ACID トランザクション、タイムトラベルクエリ(スナップショット管理)、スキーマエボリューション(カラム追加・削除・リネームを既存データへの影響なしに実行可能)を標準サポートします。Amazon Athena および AWS Glue との公式統合も提供されており、すべての要件を満たします。
D
Apache ORC(Optimized Row Columnar)
Apache ORC は列指向フォーマットで Hive との親和性が高いですが、Parquet と同様に単体では ACID トランザクションやタイムトラベルの仕組みを持ちません。

解説

Apache Iceberg はオープンテーブルフォーマットとして、ACID トランザクション、タイムトラベルクエリ(スナップショット管理)、スキーマエボリューション(カラム追加・削除・リネームを既存データへの影響なしに実行可能)を標準サポートします。Amazon Athena および AWS Glue との公式統合も提供されており、すべての要件を満たします。 選択肢Aの Apache Parquet は高性能な列指向ストレージフォーマットですが、ACID トランザクションやタイムトラベル機能は持たず、単体でのテーブル管理機能がありません。 選択肢Bの Apache Avro は行指向のシリアライゼーションフォーマットであり、テーブルフォーマットではないため、ACID 保証やスナップショット管理機能を持ちません。 選択肢Dの Apache ORC は列指向フォーマットで Hive との親和性が高いですが、Parquet と同様に単体では ACID トランザクションやタイムトラベルの仕組みを持ちません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る