MLAMLワークフローのデプロイとオーケストレーション
あるSaaS企業が50社のエンタープライズ顧客向けに、それぞれ専用の文書分類モデル(各約200MB)をSageMakerリアルタイムエンドポイント(ml.m5.large)で常時稼働させています。各モデルへのリクエストは平均30件/日で、営業時間内に不規則に発生します。現在の月額費用は約$5,400で、レイテンシー10秒以内を維持しながらコストを70%以上削減する必要があります。最もコスト効率が高い構成はどれですか?
A50モデルをSageMaker Multi-Model Endpoint(ml.m5.xlarge×2台)に統合し、リクエスト到着時にS3から対象モデルをダイナミックロードして推論を提供する
Multi-Model Endpointはml.m5.xlarge×2台の常時稼働インスタンスで50モデルを共有します。月額約$276に削減でき70%以上の要件は達成できますが、1日30件の疎なトラフィックに対しても24時間分のインスタンス料金が発生し続け、Serverless Inferenceと比べてコスト効率で大きく劣ります。
B50モデルをSageMaker Serverless Inferenceエンドポイント(メモリ2048MB、最大同時実行数5)に移行し、リクエストベースの従量課金に切り替える
✓ 正解
Serverless Inferenceはリクエストがない間はコストが発生しません。1日30件×50モデルの疎なトラフィックでは月額数ドル以下となり$5,400比で99%超の削減が可能です。200MBモデルのコールドスタートは通常2〜5秒程度で10秒のレイテンシー要件を満たし、全要件を最小コストで実現します。
C50モデルをSageMaker Async Inferenceエンドポイントに移行し、Application Auto ScalingのスケールインポリシーでDesiredCapacity=0を設定して未使用時のインスタンスをゼロに削減する
Async Inferenceはゼロインスタンスへのスケールインが設定可能ですが、ゼロからのスケールアップには3〜5分以上かかるためリクエスト到着後10秒以内の応答が保証できません。また結果をS3に書き込む非同期方式のため、同期的なリアルタイム応答が必要なリクエストパターンには設計上不適合です。
D50モデルをSageMaker Serverless Inferenceエンドポイント(メモリ2048MB)に移行し、コールドスタートを排除するためにプロビジョニング済み同時実行数を各エンドポイントに3と設定する
Serverless Inferenceのプロビジョニング済み同時実行数は、ウォームな実行環境を常時維持するため設定数に応じた固定課金が発生します。リクエストゼロの時間帯でも費用がかかり続け、アイドルコストゼロというServerless Inferenceの最大の利点が失われます。疎なトラフィックへのコスト削減効果が大幅に低減されます。
解説
SageMaker Serverless Inferenceはリクエストがない間はコストが発生しないリクエストベース課金(推論時間×GB+リクエスト数)を採用しています。1日30件×50モデル=1,500件/日という極めて疎なトラフィックでは月額数ドル以下に収まり、$5,400から99%超のコスト削減が実現できます。200MBの文書分類モデルはServerless Inferenceの最大メモリ6,144MB(6GB)の上限内に収まります。コールドスタートはモデルサイズ・ダウンロード時間・コンテナ起動時間に依存しますが、200MB程度の小規模モデルでは通常数秒程度に収まることが多く、10秒のレイテンシー要件を満たせる可能性が高いです。
選択肢AのMulti-Model Endpointは、ml.m5.xlarge×2台の常時稼働インスタンス(月額約$276)で70%以上の削減は達成できますが、1日30件の疎なトラフィックに対してもインスタンス費用が24時間発生するため、Serverless Inferenceと比べてコスト効率が大きく劣ります。
選択肢CのAsync Inferenceは、ゼロインスタンスへのスケールイン設定は可能ですが、ゼロからのスケールアップには数分以上要するため10秒以内のレイテンシー要件を満たせません。また応答がS3経由の非同期方式となり、リアルタイム性が必要なリクエストには不向きです。
選択肢DのServerless Inferenceのプロビジョニング済み同時実行数は、常時ウォームな実行環境を維持するため設定した同時実行数分の固定課金が発生します。リクエストが少ない時間帯でも費用がかかり続け、アイドルコストゼロというServerless Inferenceの最大の利点を損ないます。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →