MLAMLワークフローのデプロイとオーケストレーション
あるECサービスでは、数百種類の商品カテゴリごとにレコメンデーションモデルを保有しています。
各モデルのリクエスト頻度は低く、全モデルを常時稼働させるとコストが膨大になります。
低レイテンシー(応答時間 500ms 以内)の要件はなく、コスト最適化を最優先とする場合、最も適切なデプロイ戦略はどれですか?
A全モデルを1つの SageMaker リアルタイムエンドポイントにデプロイし、Auto Scaling を設定してトラフィックに応じてインスタンスをスケールさせる
全モデルを1つのSageMaker リアルタイムエンドポイントは、全モデルを常時メモリに保持する必要があり、数百モデルでは膨大なコストが発生します。Auto Scalingはインスタンス数を調整するのみで、個別モデルのリソース最適化にはなりません。
BSageMaker Multi-Model Endpoint(MME)を使用して全モデルを単一エンドポイントで提供し、使用頻度の低いモデルはメモリから自動的にアンロードされるようにする
✓ 正解
SageMaker Multi-Model Endpoint(MME)は複数モデルを単一エンドポイントで提供し、使用頻度の低いモデルを自動的にメモリからアンロードしてコストを大幅に削減します。数百モデルを個別エンドポイントで管理するよりも運用負荷が低く、500ms 以内の要件がない場合はモデルロード時間も許容範囲内です。
CSageMaker サーバーレス推論エンドポイントを各モデルに設定し、リクエストがない時間帯はインスタンスをゼロにスケールさせる
サーバーレス推論エンドポイントは、コスト最適化に有効ですが、数百エンドポイントの管理負荷が高く、MMEの方が適切です。
DSageMaker バッチ変換ジョブを使用して全モデルの推論を夜間バッチ処理で実行し、結果を S3 に保存してリアルタイム参照させる
バッチ変換ジョブは、定期的な一括推論には適していますが、ユーザー行動や在庫状況に応じたリアルタイムレコメンデーションには対応できません。
解説
SageMaker Multi-Model Endpoint(MME)は複数モデルを単一エンドポイントで提供し、使用頻度の低いモデルを自動的にメモリからアンロードしてコストを大幅に削減します。数百モデルを個別エンドポイントで管理するよりも運用負荷が低く、500ms 以内の要件がない場合はモデルロード時間も許容範囲内です。
選択肢Aの全モデルを1つのSageMaker リアルタイムエンドポイントは、全モデルを常時メモリに保持する必要があり、数百モデルでは膨大なコストが発生します。Auto Scalingはインスタンス数を調整するのみで、個別モデルのリソース最適化にはなりません。
選択肢Cのサーバーレス推論エンドポイントは、コスト最適化に有効ですが、数百エンドポイントの管理負荷が高く、MMEの方が適切です。
選択肢Dのバッチ変換ジョブは、定期的な一括推論には適していますが、ユーザー行動や在庫状況に応じたリアルタイムレコメンデーションには対応できません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →