MLAMLワークフローのデプロイとオーケストレーション
テナント型SaaS企業がクライアントごとにカスタマイズされた機械学習モデルを提供している。モデル数は700種類で各モデルへのリクエスト数は1日あたり数十件以下。推論レイテンシーは1秒以内、モデルサイズは平均300MB。個別エンドポイントでのホスティングはコストが膨大なため、インフラコストを最小化しながら新テナント追加にも柔軟に対応できる構成を選択せよ。
ASageMaker リアルタイムエンドポイントをAuto Scalingの最小キャパシティ0で700個作成し、需要に応じてスケールさせる
SageMaker リアルタイムエンドポイントを700個作成するとインスタンスコストが膨大になり、コスト最小化の要件に反する。
BSageMaker 非同期推論エンドポイントをテナントごとに作成し、リクエストをキューイングしてコスト効率よく処理する
SageMaker 非同期推論エンドポイントをテナントごとに作成しても個別エンドポイントのホスティングコストが発生しコスト削減にならない。
CSageMaker マルチモデルエンドポイントにS3上の全モデルを登録し、リクエスト時に動的にロードして推論する
✓ 正解
SageMaker マルチモデルエンドポイントは複数モデルを共有インフラでホストし、リクエストに応じて動的ロードしコストを最小化する。
DSageMaker マルチコンテナエンドポイントに各テナントのコンテナを配置しルーティングルールでリクエストを振り分ける
SageMaker マルチコンテナエンドポイントは少数の異種コンテナを同居させる用途向けで、700種類のモデルのホストには適さない。
解説
マルチモデルエンドポイントはS3上の多数のモデルを単一エンドポイントで共有ホストし、使用頻度に基づき動的にロード・アンロードする。低頻度多モデルのユースケースで最もコスト効率が高い。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →