MLA機械学習のためのデータ準備

小売業のデータアナリストは、月次で届くCSV形式の売上データ(約5GB)に対して、重複レコードの削除・日付フォーマットの統一・欠損値の中央値補完という3種類の変換を繰り返し適用しています。コードを一切書かずにビジュアルインターフェースで変換内容を定義し、毎月届く新しいデータに同じ変換手順を再利用できることが必須要件です。最も適切なサービスはどれですか?

A
Amazon SageMaker Data Wrangler
SageMaker Data WranglerもビジュアルですがSageMaker StudioのML特化ツールであり、月次バッチ再実行の仕組みが異なります。
B
AWS Glue DataBrew
✓ 正解
AWS Glue DataBrewはノーコードのビジュアルデータ準備サービスです。250種類以上の定義済み変換をGUI上で組み合わせ、「レシピ」として保存した後、新しいデータセットに繰り返しワンクリックで適用できます。
C
AWS Glue ETL(PySpark)
Glue ETL(PySpark)はPySparkコードの記述が必要です。
D
Amazon Athena
Amazon AthenaはSQLによるアドホッククエリが主目的で、変換レシピの保存・再利用には不向きです。

解説

AWS Glue DataBrewはノーコードのビジュアルデータ準備サービスです。250種類以上の定義済み変換をGUI上で組み合わせ、「レシピ」として保存した後、新しいデータセットに繰り返しワンクリックで適用できます。 選択肢AのSageMaker Data WranglerもビジュアルですがSageMaker StudioのML特化ツールであり、月次バッチ再実行の仕組みが異なります。 選択肢CのGlue ETL(PySpark)はPySparkコードの記述が必要です。 選択肢DのAmazon AthenaはSQLによるアドホッククエリが主目的で、変換レシピの保存・再利用には不向きです。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る