無限ノック › DEA 練習問題一覧 › 問題
DEAデータの取り込みと変換

小売業のデータアナリストチームは、複数のソースシステムから収集した商品カタログデータをデータウェアハウスに取り込む前にクレンジング・標準化する必要があります。 以下の制約・要件があります。 ・チームにはPythonやSparkの知識がなく、コーディング不要のノーコードツールを求めている ・データプロファイリング(欠損値・外れ値・重複の検出)を事前に実施したい ・変換処理はレシピとして保存し、新しいデータが届くたびに再利用したい ・処理はスケジュール実行できる必要がある この要件に最も適したAWSサービスはどれですか?

A
AWS Glue ETLジョブ(PySpark)で変換ロジックを実装し、AWS Glue Workflowでスケジュール実行する
スケジュールはPySparkによるコーディングが必要でノーコード要件を満たしません。
B
AWS Glue DataBrewでデータセットを作成してプロファイリングジョブを実行し、ノーコードでレシピを構築してDataBrewジョブをスケジュール実行する
✓ 正解
AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスです。プロファイリングジョブで欠損値・外れ値・重複を自動検出でき、250以上の組み込み変換をGUI操作でレシピとして保存・再利用し、スケジュール実行が可能です。
C
Amazon EMR上のJupyterノートブックでインタラクティブにデータクレンジングを実施し、EMRステップでスケジュールバッチ実行する
対話的分析に適しますが、Sparkスキルが必要でクラスター管理コストも増大します。
D
AWS Step Functionsで変換ワークフローを定義し、各ステップでAWS Lambdaを呼び出してPandasによるクレンジングを実行する
実現可能ですが、Pandasコードの実装が必要であり、ノーコード要件を満たしません。

解説

AWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスです。プロファイリングジョブで欠損値・外れ値・重複を自動検出でき、250以上の組み込み変換をGUI操作でレシピとして保存・再利用し、スケジュール実行が可能です。 選択肢AはスケジュールはPySparkによるコーディングが必要でノーコード要件を満たしません。 選択肢Cは対話的分析に適しますが、Sparkスキルが必要でクラスター管理コストも増大します。 選択肢Dは実現可能ですが、Pandasコードの実装が必要であり、ノーコード要件を満たしません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← DEA の問題一覧に戻る