MLチームが大規模な画像分類モデルのトレーニングをSageMakerで実施しようとしています。トレーニングには約20時間かかる見込みです。予算を最小限に抑えたいが、インスタンスが中断された場合でも途中から再開できるようにする必要があります。最もコスト効率の高いアーキテクチャはどれですか?
SageMaker Managed Spot TrainingはEC2スポットインスタンスを活用し、オンデマンドと比べて最大90%のコスト削減を実現します。スポットインスタンスは中断される可能性があるため、S3へのチェックポイント保存を設定することで中断後に自動再開できます。MaxWaitTimeパラメータで最大待機時間を指定できます。 選択肢Aの ml.p3.8xlarge オンデマンドインスタンスは、コストが安定しているが、スポット料金と比べると大幅に割高になります。 選択肢Cの AWS Lambda でトレーニングスクリプトを実行することは、最大実行時間15分の制約があり20時間のトレーニングには使用できません。 選択肢Dの SageMaker Serverless Inference を使用することは、サーバーレスで低コストだが、これはモデル推論(デプロイ後の予測実行)のサービスであり、トレーニングには使用できません。