MLAMLワークフローのデプロイとオーケストレーション

社内向けの分析ツールに組み込むMLモデルがあります。トラフィックは予測困難で散発的に発生し、何時間もリクエストがない時間帯があります。チームはアイドル時に推論コストを発生させたくなく、初回リクエスト時の多少のコールドスタート遅延は許容できます。ペイロードは小さく、推論時間も短いです。最もコスト効率の高いデプロイ方法はどれですか。

A
SageMaker サーバーレス推論(Serverless Inference)エンドポイントを構成する
✓ 正解
サーバーレス推論はリクエスト数に応じて自動でスケールし、アイドル時にはインスタンスが起動せず課金されない。コールドスタートを許容でき小ペイロード・短時間推論の散発的トラフィックに最もコスト効率が高い。
B
SageMaker リアルタイム推論エンドポイントを最小インスタンス1台で常時稼働させる
リアルタイムエンドポイントは最小1台のインスタンスが常時起動して課金が続くため、何時間もリクエストがないワークロードではアイドルコストが無駄になり、コスト効率が悪い。
C
SageMaker マルチモデルエンドポイントに複数モデルを集約して常時稼働させる
マルチモデルエンドポイントは多数のモデルを1エンドポイントに集約する用途で、常時インスタンスが稼働するためアイドルコストが発生し、散発的トラフィックの単一モデルのコスト最適化にはならない。
D
SageMaker 非同期推論(Asynchronous Inference)エンドポイントを構成する
非同期推論は大きなペイロードや長い推論時間向けでキューイングを前提とする。小ペイロード・短時間の散発リクエストには過剰で、本要件のコスト最適化の最善策とはいえない。

解説

サーバーレス推論はリクエスト数に応じて自動でスケールし、アイドル時にはインスタンスが起動せず課金されない。コールドスタートを許容でき、小ペイロード・短時間推論の散発的トラフィックに対して最もコスト効率が高い。 選択肢Bのリアルタイムエンドポイントは最小1台が常時起動し課金が続く。 選択肢Cのマルチモデルエンドポイントも常時稼働しアイドルコストが発生する。 選択肢Dの非同期推論は大ペイロード・長時間推論向けで本要件には過剰。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る