DEAデータの取り込みと変換
小売業のデータアナリストチームは、複数のソースシステムから収集した商品カタログデータをデータウェアハウスに取り込む前にクレンジング・標準化する必要があります。
以下の制約・要件があります。
・チームにはPythonやSparkの知識がなく、コーディング不要のノーコードツールを求めている
・データプロファイリング(欠損値・外れ値・重複の検出)を事前に実施したい
・変換処理はレシピとして保存し、新しいデータが届くたびに再利用したい
・処理はスケジュール実行できる必要がある
この要件に最も適したAWSサービスはどれですか?
AAWS Glue ETLジョブ(PySpark)で変換ロジックを実装し、AWS Glue Workflowでスケジュール実行する
スケジュールはPySparkによるコーディングが必要でノーコード要件を満たしません。
BAWS Glue DataBrewでデータセットを作成してプロファイリングジョブを実行し、ノーコードでレシピを構築してDataBrewジョブをスケジュール実行する
✓ 正解
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスです。プロファイリングジョブで欠損値・外れ値・重複を自動検出でき、250以上の組み込み変換をGUI操作でレシピとして保存・再利用し、スケジュール実行が可能です。
CAmazon EMR上のJupyterノートブックでインタラクティブにデータクレンジングを実施し、EMRステップでスケジュールバッチ実行する
対話的分析に適しますが、Sparkスキルが必要でクラスター管理コストも増大します。
DAWS Step Functionsで変換ワークフローを定義し、各ステップでAWS Lambdaを呼び出してPandasによるクレンジングを実行する
実現可能ですが、Pandasコードの実装が必要であり、ノーコード要件を満たしません。
解説
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスです。プロファイリングジョブで欠損値・外れ値・重複を自動検出でき、250以上の組み込み変換をGUI操作でレシピとして保存・再利用し、スケジュール実行が可能です。
選択肢AはスケジュールはPySparkによるコーディングが必要でノーコード要件を満たしません。
選択肢Cは対話的分析に適しますが、Sparkスキルが必要でクラスター管理コストも増大します。
選択肢Dは実現可能ですが、Pandasコードの実装が必要であり、ノーコード要件を満たしません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →