MLAMLワークフローのデプロイとオーケストレーション
ある SaaS 企業は顧客ごとにカスタマイズされた推薦モデルを500個保有しており、各モデルへのトラフィックは1日あたり約20リクエストと非常に少ない状況です。現在は各モデルを個別の SageMaker リアルタイムエンドポイントにデプロイしており、コストが問題になっています。コストを最小化しながら全モデルをサービングするための最適なアーキテクチャはどれですか?
A各モデルを SageMaker サーバーレス推論エンドポイント(Serverless Inference Endpoint)に個別デプロイする
サーバーレス推論は500個の個別エンドポイントを管理する必要があり運用が複雑化します。
BSageMaker マルチコンテナエンドポイント(Multi-Container Endpoint)を使用して複数モデルを1エンドポイントにまとめる
マルチコンテナエンドポイントは最大15コンテナまでの制限があり500モデルへのスケールには不適切です。
Cモデルを ECS(Amazon Elastic Container Service)上にコンテナとしてデプロイし、ALB(Application Load Balancer)でルーティングする
ECS+ALBはSageMakerのモデル管理機能を利用しない自前構築となり、モデルサービング基盤の維持・管理コストが大きくなります。
DSageMaker マルチモデルエンドポイント(Multi-Model Endpoint)を使用し、少数インスタンスで全モデルをホスティングする
✓ 正解
SageMaker マルチモデルエンドポイント(MME)は単一エンドポイントで複数のモデルを動的にロード・アンロードします。使用頻度の低いモデルはメモリから解放され、リクエスト時にS3から動的にロードされるため、500モデルを少数インスタンスで運用でき大幅なコスト削減が実現します。
解説
SageMaker マルチモデルエンドポイント(MME)は単一エンドポイントで複数のモデルを動的にロード・アンロードします。使用頻度の低いモデルはメモリから解放され、リクエスト時にS3から動的にロードされるため、500モデルを少数インスタンスで運用でき大幅なコスト削減が実現します。
選択肢Aのサーバーレス推論は500個の個別エンドポイントを管理する必要があり運用が複雑化します。
選択肢Bのマルチコンテナエンドポイントは最大15コンテナまでの制限があり500モデルへのスケールには不適切です。
選択肢CのECS+ALBはSageMakerのモデル管理機能を利用しない自前構築となり、モデルサービング基盤の維持・管理コストが大きくなります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →