ML エンジニアリングチームは statsmodels と pmdarima を使用した独自の時系列特徴量エンジニアリングスクリプトを保有しています。 このスクリプトを月次で S3 上の 300GB データに対して実行し、SageMaker トレーニングジョブの入力として使いたいと考えています。 スクリプトの改修を最小限にしつつインフラ管理を抑えてスケーラブルに実行できる最も適切な方法はどれですか。
SageMaker Processing Jobs は BYOC(Bring Your Own Container)をサポートしており、ECR に登録したカスタム Docker コンテナをそのまま実行環境として使用できる。statsmodels・pmdarima などの任意ライブラリを含む環境でスクリプトの変更なしに実行でき、分散処理(複数インスタンス設定)も可能。S3 との入出力が自動でマウントされ、SageMaker Pipelines への組み込みも容易でインフラ管理が最小化される。 選択肢Aの AWS Lambda は実行時間が最大 15 分・デプロイパッケージが最大 250MB という制限があり、300GB データの処理や statsmodels/pmdarima のような重厚な依存ライブラリには対応できない。 選択肢Cの AWS Glue ETL は Spark ベースのサービスであり、statsmodels・pmdarima は Spark 分散処理に非対応なため Spark API への大幅な書き直しが必要となり、スクリプト改修最小化の要件に反する。 選択肢Dの EC2 インスタンス運用はスクリプト変更が不要だが、インスタンス管理・起動スクリプト・障害対応など手動運用が必要で、SageMaker Processing Job と比較してインフラ管理負荷が高い。