MLA機械学習のためのデータ準備

データサイエンティストが、小売企業の販売予測モデル向けに特徴量エンジニアリングを実施しています。S3に格納された3年分のPOSデータ(CSV形式、月次1億レコード)について、欠損値補完・カテゴリ変数のターゲットエンコーディング・7日/30日移動平均計算が必要です。SQL/Pythonが使えるデータサイエンティストが、データ分布を視覚的に確認しながら変換ロジックを試行し、完成後は自動化パイプラインとして本番環境で定期実行したい場合、最適なサービスはどれですか?

A
Glue DataBrewで視覚的なレシピを作成し、スケジュールジョブとしてS3データをバッチ変換する本番パイプラインを構築する
Glue DataBrewはノーコードのデータ品質チェックとレシピ変換に強みがあるが、変換コードをSageMaker Pipelinesに直接エクスポートする機能を持たず、本番化に別途実装が必要になる。
B
SageMaker Data Wranglerでデータ探索・変換を試行し、完成後にSageMaker Pipelines用Processing Jobコードをエクスポートして本番化する
✓ 正解
SageMaker Data WranglerはGUIでデータ探索と変換試行を行い、完成後のコードをSageMaker PipelinesのProcessing Jobとして直接エクスポートして本番化できる設計になっている。
C
Amazon EMR上でPySparkスクリプトを作成してS3データを大規模処理し、SageMaker Processing Jobから定期実行するパイプラインを構築する
Amazon EMR PySpark は大規模処理に適しているが、視覚的なデータプロファイリング環境を持たず、データサイエンティストが変換ロジックをコードから全て実装する必要があり試行コストが高い。
D
AWS GlueのビジュアルETLエディターでSparkジョブを構築し、Glueワークフローのスケジューラーで定期バッチ変換を自動実行する
AWS GlueのビジュアルETLはETLパイプライン構築に優れるが、データ統計探索とSageMaker Pipelinesへの直接コードエクスポートはData Wranglerが専用サービスとして提供している。

解説

SageMaker Data WranglerはGUIによるデータプロファイリングとインタラクティブな変換試行環境を提供し、完成した変換ロジックをSageMaker PipelinesのProcessing Jobコードとしてエクスポートして本番パイプラインに直接組み込める。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る