MLAMLワークフローのデプロイとオーケストレーション
MLチームがScikit-learnによる前処理コンテナとXGBoostによる推論コンテナを別々に開発しました。本番では前処理の出力を推論コンテナへ直接渡す単一エンドポイントとして公開したく、管理するエンドポイント数を最小化したいと考えています。最も適切なSageMaker機能はどれですか?
ASageMaker マルチモデルエンドポイント(Multi-Model Endpoint)に2つのモデルをホストして動的に切り替える
マルチモデルエンドポイントは複数の独立したモデルを1ホストに集約する用途であり逐次処理には対応しません。
BSageMaker シリアル推論パイプライン(Serial Inference Pipeline)を使い、2つのコンテナを直列連結した単一エンドポイントを作成する
✓ 正解
SageMakerシリアル推論パイプラインは最大15個のコンテナを順番に連結し、前段の出力が次のコンテナの入力になる単一エンドポイントを提供します。Scikit-learn前処理+XGBoost推論のような構成で広く使われます。
CAWS Lambdaで前処理を実行してSageMakerリアルタイムエンドポイントを呼び出す2段構成にする
Lambda で前処理を実行してSageMakerリアルタイムエンドポイントを呼び出す方式は可能ですが、管理するエンドポイント数を最小化するという要件に反します。
DSageMaker Pipelinesのステップとして前処理と推論を定義し、推論リクエストのたびにパイプラインを実行する
SageMaker Pipelinesを推論のたびに実行するのは高レイテンシかつ高コストで現実的ではありません。
解説
正解:
SageMaker シリアル推論パイプライン(Serial Inference Pipeline)を使い、2つのコンテナを直列連結した単一エンドポイントを作成する。
SageMakerシリアル推論パイプラインは最大15個のコンテナを順番に連結し、前段の出力が次のコンテナの入力になる単一エンドポイントを提供します。Scikit-learn前処理+XGBoost推論のような構成で広く使われます。
選択肢Aは マルチモデルエンドポイントは複数の独立したモデルを1ホストに集約する用途であり逐次処理には対応しません。
選択肢Cは Lambda で前処理を実行してSageMakerリアルタイムエンドポイントを呼び出す方式は可能ですが、管理するエンドポイント数を最小化するという要件に反します。
選択肢Dは SageMaker Pipelinesを推論のたびに実行するのは高レイテンシかつ高コストで現実的ではありません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →