無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

データサイエンティストチームが、S3 に格納された 1,000 万行の CSV 形式の顧客データに対して繰り返し可能なデータクレンジングを実施したい。 チームの要件は以下の通りである: ・コードを書かずにビジュアル操作で変換を定義できる ・変換ステップを「レシピ」として保存し、別のデータセットに再適用できる 開発工数を最小限に抑えながら要件を満たすサービスはどれか。

A
AWS Glue ETL ジョブで PySpark スクリプトを作成し、変換ロジックをコードとして管理する
AWS Glue ETL ジョブで PySpark スクリプトを作成し、変換ロジックをコードとして管理することは可能ですが、コード記述が必要であり要件に合致しません。
B
AWS Glue DataBrew でビジュアルにレシピを定義し、データプロファイリングで品質確認後に変換ジョブを実行する
✓ 正解
AWS Glue DataBrewはGUIベースのビジュアルデータ準備サービス。変換手順を「レシピ」として記録・保存し、異なるデータセットへ再適用できます。組み込みのデータプロファイリング機能で欠損値・外れ値・統計分布をコード不要で確認できます。
C
Amazon EMR 上で Apache Spark ジョブとして変換スクリプトを実装する
Amazon EMR 上で Apache Spark ジョブとして変換スクリプトを実装することはコード記述が必要です。
D
SageMaker Processing Job で Scikit-learn を使用して変換パイプラインを実装する
SageMaker Processing Job で Scikit-learn を使用して変換パイプラインを実装することはコード記述が必要です。他の選択肢はすべてコード記述が必要であり、「コードなし・再現性・大規模データ」という要件を最も効率よく満たすのはDataBrew。

解説

選択肢Aは、AWS Glue ETL ジョブでPySparkスクリプトを使う方法はデータ変換自体は可能ですが、コードの記述が必要であり「コード不要」という要件に合致しません。 選択肢Bは、AWS Glue DataBrewはGUIベースのビジュアルデータ準備サービスです。変換手順を「レシピ」として記録・保存し、異なるデータセットへ再適用できます。組み込みのデータプロファイリング機能で欠損値・外れ値・統計分布をコード不要で確認でき、1,000万行規模の大規模データにも対応します。 選択肢Cは、Amazon EMR上でApache Sparkジョブとして変換スクリプトを実装する方法はコード記述が必要であり「コード不要」という要件に合致しません。 選択肢Dは、SageMaker Processing JobでScikit-learnを使用する方法はコード記述が必要であり「コード不要」という要件に合致しません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る