MLA機械学習のためのデータ準備
データサイエンティストチームが、S3 に格納された 1,000 万行の CSV 形式の顧客データに対して繰り返し可能なデータクレンジングを実施したい。
チームの要件は以下の通りである:
・コードを書かずにビジュアル操作で変換を定義できる
・変換ステップを「レシピ」として保存し、別のデータセットに再適用できる
開発工数を最小限に抑えながら要件を満たすサービスはどれか。
AAWS Glue ETL ジョブで PySpark スクリプトを作成し、変換ロジックをコードとして管理する
AWS Glue ETL ジョブで PySpark スクリプトを作成し、変換ロジックをコードとして管理することは可能ですが、コード記述が必要であり要件に合致しません。
BAWS Glue DataBrew でビジュアルにレシピを定義し、データプロファイリングで品質確認後に変換ジョブを実行する
✓ 正解
AWS Glue DataBrewはGUIベースのビジュアルデータ準備サービス。変換手順を「レシピ」として記録・保存し、異なるデータセットへ再適用できます。組み込みのデータプロファイリング機能で欠損値・外れ値・統計分布をコード不要で確認できます。
CAmazon EMR 上で Apache Spark ジョブとして変換スクリプトを実装する
Amazon EMR 上で Apache Spark ジョブとして変換スクリプトを実装することはコード記述が必要です。
DSageMaker Processing Job で Scikit-learn を使用して変換パイプラインを実装する
SageMaker Processing Job で Scikit-learn を使用して変換パイプラインを実装することはコード記述が必要です。他の選択肢はすべてコード記述が必要であり、「コードなし・再現性・大規模データ」という要件を最も効率よく満たすのはDataBrew。
解説
選択肢Aは、AWS Glue ETL ジョブでPySparkスクリプトを使う方法はデータ変換自体は可能ですが、コードの記述が必要であり「コード不要」という要件に合致しません。
選択肢Bは、AWS Glue DataBrewはGUIベースのビジュアルデータ準備サービスです。変換手順を「レシピ」として記録・保存し、異なるデータセットへ再適用できます。組み込みのデータプロファイリング機能で欠損値・外れ値・統計分布をコード不要で確認でき、1,000万行規模の大規模データにも対応します。
選択肢Cは、Amazon EMR上でApache Sparkジョブとして変換スクリプトを実装する方法はコード記述が必要であり「コード不要」という要件に合致しません。
選択肢Dは、SageMaker Processing JobでScikit-learnを使用する方法はコード記述が必要であり「コード不要」という要件に合致しません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →