MLA機械学習のためのデータ準備

ある金融サービス企業では、15の異なるソースシステムからCSV形式のトランザクションデータが毎日届きます。プログラミングスキルを持たないビジネスアナリストが、以下のデータ品質プロファイリングと標準化変換をコードなしで実施し、結果を視覚的に確認する必要があります。 ・日付フォーマットの不統一 ・文字列の余分なスペース ・欠損値の割合確認 この要件を最もよく満たすサービスはどれですか?

A
Amazon SageMaker Data Wrangler
SageMaker Data Wranglerは視覚的ですが、ML用途・SageMaker統合向けであり、汎用的なデータ品質管理にはDataBrewが適切です。
B
PySparkを使用したAWS Glue ETL
Glue ETLは、Pythonコードの記述が必要なため非プログラマーには不向きです。
C
AWS Glue DataBrew
✓ 正解
AWS Glue DataBrewはコード不要のビジュアル型データ準備・プロファイリングサービスで、250以上の組み込み変換と自動データ品質プロファイリング(欠損値割合・外れ値・重複の可視化)を提供します。
D
scikit-learnを使用したAmazon SageMaker Processing
SageMaker Processingは、Pythonコードの記述が必要なため非プログラマーには不向きです。

解説

選択肢AのSageMaker Data Wranglerは、視覚的なデータ準備ツールですが、ML用途・SageMaker統合向けであり、汎用的なデータ品質管理にはDataBrewが適切です。 選択肢BのGlue ETLは、PythonコードやSparkスクリプトの記述が必要なため、プログラミングスキルを持たないビジネスアナリストには不向きです。 選択肢CのAWS Glue DataBrewは、コード不要のビジュアル型データ準備・プロファイリングサービスで、250以上の組み込み変換と自動データ品質プロファイリング(欠損値割合・外れ値・重複の可視化)を提供し、最適な選択です。 選択肢DのSageMaker Processingは、scikit-learnなどのPythonコードの記述が必要なため、プログラミングスキルを持たないビジネスアナリストには不向きです。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る