MLA機械学習のためのデータ準備
あるデータアナリストチームは、S3に保存された数百万行の顧客購買データに対し、MLトレーニング前のデータ品質評価を行う必要があります。欠損値の割合・数値列の分布・外れ値を可視化するプロファイルレポートをコードを書かずに作成したいと考えています。また、変換処理を「レシピ」として保存し再利用できることも要件です。最も適切なAWSサービスはどれか?
AAWS Glue DataBrew を使用してデータプロファイルを作成し、変換レシピを定義する
✓ 正解
AWS Glue DataBrew はコード不要のビジュアルデータ準備ツールで、250以上の組み込み変換と自動プロファイリング(欠損値率・分布・外れ値など)を提供します。変換手順を「レシピ」として保存・再利用可能です。
BAmazon SageMaker Data Wrangler でデータフローを作成してプロファイリングと変換を行う
Data WranglerはSageMaker Studio内のML特化ツールであり、コードレスプロファイリング機能はDataBrewほど充実していない。
CAmazon Athena でSQLクエリを実行してデータ品質を手動で確認する
Athenaは手動SQLクエリによる確認が必要でコード不要という要件に反する。
DAWS Glue Studio でビジュアルETLジョブを構築してデータを変換する
Glue Studioはビジュアルなコード不要のETLジョブ構築には適しますが、統計プロファイルの自動生成やレシピ機能を備えておらず、データ品質評価の専門機能においてDataBrewに劣る。
解説
AWS Glue DataBrew はコード不要のビジュアルデータ準備ツールで、250以上の組み込み変換と自動プロファイリング(欠損値率・分布・外れ値など)を提供します。変換手順を「レシピ」として保存・再利用可能です。
選択肢BのData WranglerはSageMaker Studio内のML特化ツールであり、コードレスプロファイリング機能はDataBrewほど充実していない。
選択肢CのAthenaは手動SQLクエリによる確認が必要でコード不要という要件に反する。
選択肢DのGlue Studioはビジュアルなコード不要のETLジョブ構築には適しますが、統計プロファイルの自動生成やレシピ機能を備えておらず、データ品質評価の専門機能においてDataBrewに劣る。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →