データサイエンティストが顧客解約予測モデルの特徴量セットを構築するため、以下の3つのデータソースを結合して特徴量エンジニアリングを行い、結果を SageMaker Feature Store にエクスポートしたいと考えています。 (1) Amazon RDS(PostgreSQL)の顧客デモグラフィックデータ (2) S3(Parquet 形式)の購買履歴データ (3) Amazon Redshift の顧客サポート対応履歴データ カスタムコードを最小限に抑えてこのパイプラインを構築する方法はどれですか?
Amazon SageMaker Canvas で RDS・S3・Redshift に直接接続し、GUI でデータ結合・特徴量エンジニアリングを実施後、SageMaker Feature Store へのエクスポートパイプラインを自動生成する。 Amazon SageMaker Canvas は SageMaker Data Wrangler(2025年9月 EOL)の後継として、S3・RDS・Redshift・Athena など複数データソースへの直接接続をサポートし、GUI ベースでのデータ結合・変換・特徴量エンジニアリングが可能です。作成したデータフローから Feature Store への ingestion パイプラインを自動生成でき、カスタムコードを最小限に抑えられます。 選択肢Aはコーディングが必要です。Glue ETL ジョブを作成して3ソースのデータを結合し、SageMaker Training Job 内でカスタムスクリプトを使用する必要があります。 選択肢Cはコーディングが必要です。Amazon EMR で PySpark スクリプトを作成して3ソースのデータを統合する必要があります。 選択肢Dはメモリ・実行時間に制限があり、大規模データ結合処理には不適切です。AWS Lambda で RDS・S3・Redshift をクエリして結合処理を実装する方法は限界があります。