無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

EC サイト企業のデータサイエンスチームは、S3 に保存された 60 GB の顧客取引データをモデルトレーニング用に準備する必要があります。チームメンバーはコーディング経験が少なく、データ品質プロファイリング(NULL 値割合・分布統計・外れ値の検出)と標準的な変換処理(日付フォーマット統一・文字列正規化)をコード不要で実施したいと考えています。さらに変換手順を再利用可能な形で保存したいという要件もあります。最も適切な AWS サービスはどれですか?

A
AWS Glue ETL ジョブで PySpark スクリプトを記述してデータプロファイリングと変換処理を実装する
AWS Glue ETL ジョブで PySpark スクリプトを記述してデータプロファイリングと変換処理を実装することはコーディングが必要です。
B
Amazon SageMaker Processing ジョブで Pandas スクリプトを実行してデータ品質チェックと変換処理を行う
Amazon SageMaker Processing ジョブで Pandas スクリプトを実行してデータ品質チェックと変換処理を行うことはコーディングが必要です。
C
AWS Glue DataBrew のビジュアルインターフェースでプロファイリングジョブを実行し、組み込みトランスフォーメーションでレシピとして変換手順を定義・保存する
✓ 正解
AWS Glue DataBrew はコード不要のビジュアルデータ準備ツールです。データプロファイリング機能では列統計・NULL値割合・外れ値・データ分布を自動分析できます。250以上の組み込みトランスフォーメーションから選択してレシピとして保存・再利用でき、コーディングスキルが限られたチームに最適です。
D
Amazon Athena で SQL クエリを実行してプロファイリング情報を取得し、AWS Lambda で変換処理を実装して S3 に出力する
Amazon Athena で SQL クエリを実行してプロファイリング情報を取得し、AWS Lambda で変換処理を実装して S3 に出力することは構築・管理コストが高くなります。

解説

AWS Glue DataBrew はコード不要のビジュアルデータ準備ツールです。データプロファイリング機能では列統計・NULL値割合・外れ値・データ分布を自動分析できます。250以上の組み込みトランスフォーメーションから選択してレシピとして保存・再利用でき、コーディングスキルが限られたチームに最適です。 選択肢A の AWS Glue ETL ジョブで PySpark スクリプトを記述してデータプロファイリングと変換処理を実装することはコーディングが必要です。 選択肢B の Amazon SageMaker Processing ジョブで Pandas スクリプトを実行してデータ品質チェックと変換処理を行うことはコーディングが必要です。 選択肢D の Amazon Athena で SQL クエリを実行してプロファイリング情報を取得し、AWS Lambda で変換処理を実装して S3 に出力することは構築・管理コストが高くなります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る