MLAMLワークフローのデプロイとオーケストレーション

あるSaaSプロバイダーが中小企業向け需要予測サービスを提供しています。顧客企業は500社あり、各社のビジネスドメインに特化した個別の機械学習モデル(合計500モデル)がSageMaker上でトレーニングされています。各顧客からのAPIリクエストは散発的で、1社あたり1日数回程度しか発生しません。コストを最小化しながら全500モデルをホスティングするための最も適切なアーキテクチャはどれですか?

A
各顧客モデルに対して個別のSageMakerリアルタイム推論エンドポイントを作成し、合計500エンドポイントを常時稼働させる
個別エンドポイント方式は、500個の個別エンドポイントの維持により高額なコストが発生します。
B
SageMaker マルチモデルエンドポイント(MME)を使用し、全500モデルを単一エンドポイントに統合してホスティングする
✓ 正解
SageMaker マルチモデルエンドポイント(MME)は複数モデルを単一エンドポイントで提供し、リクエスト頻度に応じてモデルを動的にメモリへロード・アンロードします。500個の個別エンドポイントを維持するよりも大幅にコスト削減できます。
C
SageMaker Serverless Inferenceエンドポイントを顧客ごとに個別に500個デプロイし、アイドル時のコストをゼロにする
Serverless Inferenceは個別コストは低いですが500エンドポイントの管理オーバーヘッドが発生し、MMEほど効率的ではありません。
D
SageMaker バッチ変換ジョブを使用し、全顧客のリクエストを1日1回まとめて処理する
バッチ変換は、リアルタイムAPIには不適切です。

解説

選択肢Aの個別エンドポイント方式は、500個の常時稼働エンドポイントの維持コストが非常に高額になります。 選択肢Bの SageMaker マルチモデルエンドポイント(MME)は、複数モデルを単一エンドポイントで提供し、リクエスト頻度に応じてモデルを動的にメモリへロード・アンロードします。500個の個別エンドポイントを維持するよりも大幅にコストを削減でき、最適な選択です。 選択肢CのServerless Inferenceは個別コストは低いですが、500エンドポイントの管理オーバーヘッドが発生し、MMEほど効率的ではありません。 選択肢Dのバッチ変換は、リアルタイムAPIリクエストへの応答が求められる本ユースケースには不適切です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る