MLAMLワークフローのデプロイとオーケストレーション

ML エンジニアが毎週 S3 に到着する EC(eコマース)購買データに対して、カテゴリ変数のOne-hotエンコーディング(カテゴリ値を 0/1 の数値配列に変換する手法)・数値特徴量の標準化・欠損値の中央値補完という同一の前処理を繰り返し実施し、SageMaker トレーニングジョブへ渡している。この前処理とトレーニングのワークフローを完全に自動化したい。最適なアーキテクチャはどれか。

A
SageMaker Data Wrangler でデータ変換フローを定義し、SageMaker Pipelines のステップとして組み込み、S3 イベント通知または EventBridge でパイプラインをトリガーする
✓ 正解
SageMaker Data Wranglerで定義した変換フローはSageMaker Processing Jobとしてエクスポートでき、SageMaker Pipelinesの1ステップとして統合可能です。S3イベント通知やEventBridgeでパイプラインを自動トリガーすることで、データ到着→前処理→トレーニングの一連の流れを完全自動化できます。
B
Jupyter Notebook に前処理コードを記述し、Amazon EC2 インスタンス上で毎週手動実行する
Jupyter NotebookをEC2で毎週手動実行する構成は「完全自動化」の要件を満たしません。
C
AWS Glue DataBrew でレシピを作成し、AWS Batch でスケジュール実行してから手動でトレーニングジョブを起動する
Glue DataBrewとBatchで前処理を自動化できますが、トレーニングジョブの起動は手動のままで完全自動化にはなりません。
D
SageMaker Autopilot を使用してデータ変換とモデル選択を完全自動化する
AutopiloはML全体を自動化しますが、個別の前処理ステップを細かく制御することが困難なため要件に合いません。

解説

SageMaker Data Wranglerで定義した変換フローはSageMaker Processing Jobとしてエクスポートでき、SageMaker Pipelinesの1ステップとして統合可能です。S3イベント通知やEventBridgeでパイプラインを自動トリガーすることで、データ到着→前処理→トレーニングの一連の流れを完全自動化できます。 選択肢BのJupyter NotebookをEC2で毎週手動実行する構成は「完全自動化」の要件を満たしません。 選択肢CのGlue DataBrewとBatchで前処理を自動化できますが、トレーニングジョブの起動は手動のままで完全自動化にはなりません。 選択肢DのSageMaker Autopilotは機械学習全体を自動化しますが、個別の前処理ステップを細かく制御することが困難なため要件に合いません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る