MLA機械学習のためのデータ準備
機械学習チームは、S3に保存された100GBの顧客行動データに対して、コードを書かずにデータプロファイリングと変換を実施したいと考えています。さらに、作成した変換処理(欠損値補完・外れ値除去・正規化)を「レシピ」として保存し、毎月新規データが到着するたびに再利用できるようにしたいです。最小の開発工数でこの要件を満たすAWSサービスはどれですか?
AAWS Glue DataBrew を使用してノーコードで変換レシピを作成し、スケジュールされたジョブで新規データに適用する
✓ 正解
AWS Glue DataBrew はノーコードで変換レシピを作成でき、スケジュール実行も容易です。変換手順を再利用可能なレシピとして保存でき、定期的な再適用に最適化されています。
BSageMaker Data Wrangler でフローを作成し、SageMaker Processing ジョブとしてエクスポートして定期実行する
Data Wrangler はビジュアルな変換機能を持ちますが、レシピ管理や定期実行では DataBrew より手間がかかります。
CAWS Glue ETL スクリプトをPythonで作成し、Glue Workflowでスケジュール実行する
Glue ETL スクリプト作成はコード記述が必要であり、最小開発工数の要件に合致しません。
DAmazon EMR 上で Apache Spark スクリプトを作成し、AWS Step Functions でオーケストレーションする
EMR と Step Functions の組み合わせもコード記述が必須であり、ノーコード要件を満たしません。
解説
AWS Glue DataBrew はコード不要でデータプロファイリングと変換を行えるビジュアルサービスです。変換手順を「レシピ」として保存・再利用でき、スケジュール実行も可能です。
選択肢Bも視覚的な変換機能を持ちますが、DataBrewの方が定期的な再適用を前提としたレシピ管理に特化しており、最小開発工数を実現します。
選択肢Cと選択肢Dはコード記述が必要であり、要件を満たしません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →