DEAデータの取り込みと変換
あるデータ分析チームは、Amazon S3に蓄積された顧客アンケートのCSVデータに対して、欠損値の補完、列名の正規化、外れ値の除去といったクレンジングを行いたいと考えています。チームのメンバーはアナリストが中心でPython/Sparkのコーディング経験が乏しく、視覚的なインターフェースで変換ルールを構築し、処理前にデータ品質を統計的にプロファイリングしたいと考えています。最小の運用負荷でこの要件を満たす方法はどれですか。
AAWS Glue DataBrewでデータセットをプロファイリングし、ビジュアルレシピでクレンジング変換を定義してジョブ実行する
✓ 正解
コードを書かずにビジュアルレシピで欠損値補完・正規化・外れ値除去を定義でき、実行前のデータプロファイリングで統計値や欠損率を可視化できるため、コーディング経験の乏しいアナリストでも最小の運用負荷で要件を満たせます。
BAWS Glue Studioでカスタムのpyspark変換スクリプトを記述してETLジョブを構築し実行する
Glue Studioは一部GUI操作が可能なものの、外れ値除去のような複雑なクレンジングではpysparkコードの記述が必要になり、コーディング経験が乏しいという前提条件を満たせません。
CAmazon EMR上でApache Sparkクラスターを起動し、DataFrame APIで欠損値補完と正規化を実装する
EMRはSparkクラスターのプロビジョニングと管理が必要で、DataFrame APIによるコード実装も求められるため、ノーコードかつ最小の運用負荷という要件に反します。
DAWS Lambda関数をS3イベントでトリガーし、pandasライブラリでCSVを読み込みクレンジングを行う
Lambdaはpandasによる変換コードを自分で実装する必要があり、データプロファイリング機能も持たず、大規模CSVでは15分のタイムアウト制約に達するため不適切です。
解説
AWS Glue DataBrewは、コードを書かずにデータのクレンジングと正規化を行えるビジュアルデータ準備ツールです。
250種類以上の組み込み変換(欠損値補完、列名変更、外れ値除去など)をGUIでレシピとして組み立てられます。
またデータプロファイリング機能により、実行前に列ごとの統計値や欠損率、データ分布を可視化できます。Sparkの知識が不要で運用負荷が最小です。
選択肢Bの AWS Glue Studio は一部ノーコード操作も可能ですが、外れ値除去など複雑な変換ではpyspark記述が必要になりコーディング経験を要する。
選択肢Cの Amazon EMR はSparkクラスターの管理とコード実装が必要で、ノーコード要件・運用負荷最小に反する。
選択肢Dの AWS Lambda はpandasコードの記述が必要なうえ、プロファイリング機能がなく、大きなCSVでは15分のタイムアウト制約を受ける。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでDEAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →