MLA機械学習のためのデータ準備
EC サイトのデータチームが新しい商品推薦モデルの開発を開始します。S3 には過去 3 年分の注文データ(約 5 億行)が CSV 形式で保存されていますが、データ品質の状態は不明です。データサイエンティストはコードを書かずにデータ品質(欠損値の割合・数値分布・カテゴリの重複・外れ値)を素早く把握し、標準的な前処理変換(型変換・文字列正規化・欠損値補完)を再利用可能なパイプラインとして定義したいと考えています。最適なサービスはどれですか?
AAmazon Athena で SQL クエリを実行して統計情報を手動収集し、AWS Glue ETL スクリプトで前処理を実装する
Amazon AthenaのSQLクエリとGlue ETLスクリプトはSQLおよびPythonコーディングが必要であり、「コードを書かずに」という要件を満たしません。プロファイリング結果の可視化やレシピのような再利用可能なパイプライン定義の機能もありません。
BAWS Glue DataBrew でデータプロファイリングジョブを実行してデータ品質を可視化し、レシピ(変換ステップの集合)として再利用可能な前処理パイプラインを定義する
✓ 正解
AWS Glue DataBrewはコード不要のビジュアルデータ準備ツールであり、プロファイリングジョブで欠損値・分布・重複・外れ値を自動可視化します。「レシピ」として変換ステップを定義・再利用でき、新しいデータに同じ前処理を繰り返し適用できます。
CAmazon SageMaker Data Wrangler でデータをインポートし、組み込みの分析機能とカスタム変換を使用してデータを準備する
SageMaker Data Wranglerも組み込み分析とノーコード変換を提供しますが、約5億行規模での完全プロファイリングや、DataBrewのレシピのような再利用可能なパイプライン管理の観点ではDataBrewがより適しています。
DAWS Glue クローラーでスキーマを検出し、Glue ETL ジョブで統計情報を計算するカスタム PySpark スクリプトを作成する
Glueクローラーによるスキーマ検出とPySparkによる統計計算はPythonコーディングが必要であり、「コードを書かずに」という要件を満たしません。PySpark開発には専門知識が必要で、素早くデータ品質を把握するという目的にも合いません。
解説
AWS Glue DataBrewはコード不要のビジュアルデータ準備ツールであり、プロファイリングジョブで欠損値・分布・重複・外れ値を自動可視化します。「レシピ」として変換ステップを定義・再利用でき、新しいデータに繰り返し同じ処理を適用できます。
Amazon AthenaのSQLクエリとGlue ETLスクリプトはコーディングが必要で、「コードを書かずに」という要件を満たしません。
SageMaker Data Wranglerも有効ですが、大規模データの完全プロファイリングと再利用可能なレシピ管理はDataBrewがより適しています。
GlueクローラーとPySparkスクリプトもコーディングが必要で、「コードを書かずに」という要件を満たしません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →