MLA機械学習のためのデータ準備
データエンジニアがAWS上のデータレイクに蓄積された複数テーブルのデータ品質を定期的に評価する必要があります。
欠損値率・外れ値・統計分布のプロファイルレポートをコードなしで生成し、
250以上の組み込み変換を適用してクレンジング済みデータをS3に保存したいと考えています。
最も要件に合致するサービスはどれですか?
AAmazon SageMaker Processing
Pythonなどのコードを記述して分散データ処理を実行するサービスです。カスタムスクリプトの作成が必須であり、コードなしでプロファイリングレポートを自動生成したり250以上の組み込み変換を利用したりする要件には対応していません。
BAmazon Athena
S3上のデータにSQLを実行するサーバーレスクエリサービスです。データの統計プロファイリングレポートの自動生成や250以上の組み込みデータ変換機能を備えておらず、データ品質評価・クレンジングの要件には適していません。
CAWS Glue DataBrew
✓ 正解
コーディング不要のビジュアルデータ準備サービスです。250以上の組み込み変換と自動プロファイリング機能で欠損値・外れ値・統計分布のレポートをコードなしで生成し、クレンジング済みデータをS3に保存できます。
DAmazon SageMaker Clarify
機械学習モデルのバイアス検出と予測の説明可能性分析に特化したサービスです。欠損値や外れ値のプロファイリングレポート生成や、汎用的なデータクレンジング変換機能は提供しておらず、この要件には適していません。
解説
選択肢CのAWS Glue DataBrewはコーディング不要のビジュアルデータ準備サービスで、250以上の組み込み変換と自動データプロファイリング機能を備えています。欠損値・外れ値・統計分布のレポートを自動生成してS3に出力できます。
選択肢AのAmazon SageMaker Processingはコード記述が必要であり、要件に適合しません。
選択肢BのAmazon Athenaはクエリ実行サービスであり、データプロファイリングと自動変換機能は提供しません。
選択肢DのAmazon SageMaker ClarifyはMLバイアス検出用であり、データプロファイリングとクレンジング変換の用途には適していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →