データサイエンティストが、小売企業の販売予測モデル向けに特徴量エンジニアリングを実施しています。S3に格納された3年分のPOSデータ(CSV形式、月次1億レコード)について、欠損値補完・カテゴリ変数のターゲットエンコーディング・7日/30日移動平均計算が必要です。SQL/Pythonが使えるデータサイエンティストが、データ分布を視覚的に確認しながら変換ロジックを試行し、完成後は自動化パイプラインとして本番環境で定期実行したい場合、最適なサービスはどれですか?
SageMaker Data WranglerはGUIによるデータプロファイリングとインタラクティブな変換試行環境を提供し、完成した変換ロジックをSageMaker PipelinesのProcessing Jobコードとしてエクスポートして本番パイプラインに直接組み込める。