MLAMLワークフローのデプロイとオーケストレーション

あるスタートアップがソーシャルメディア監視向けのセンチメント分析(感情分析)サービスを運営しています。トラフィックパターンは非常に不規則で、大型イベント時には毎分1万リクエストに急増しますが、閑散期には1時間に10リクエスト未満になることもあります。レイテンシ要件は5秒以内です。最もコスト効率の高いデプロイ方法はどれですか?

A
リアルタイムエンドポイントにオートスケーリングを設定し、最小1インスタンス・最大10インスタンスで運用する
オートスケーリング付きリアルタイムエンドポイントは最小1インスタンスが常時稼働するため閑散期もコストが発生します。
B
EventBridge のスケジュールで定期的に Batch Transform ジョブをトリガーし、蓄積リクエストを一括処理する
Batch Transform は非同期一括処理向けでリアルタイム応答には不向きです。
C
SageMaker Serverless Inference エンドポイントを使用し、リクエストがない間はインスタンスをゼロにスケールダウンしてコストを排除する
✓ 正解
SageMaker Serverless Inference はリクエストがない間はインスタンスを完全に停止(ゼロスケール)するため、閑散期のコストがゼロになります。急増トラフィックも自動スケールで対応でき、5秒以内のレイテンシ要件(コールドスタート込み)も許容範囲内です。
D
SageMaker 非同期推論(Async Inference)エンドポイントと SQS キューを組み合わせてリクエストをバッファリングする
Async Inference は数十秒以上かかる長時間推論向けのサービスです。

解説

SageMaker Serverless Inference はリクエストがない間はインスタンスを完全に停止(ゼロスケール)するため、閑散期のコストがゼロになります。急増トラフィックも自動スケールで対応でき、5秒以内のレイテンシ要件(コールドスタート込み)も許容範囲内です。 選択肢Aのオートスケーリング付きリアルタイムエンドポイントは最小1インスタンスが常時稼働するため閑散期もコストが発生します。 選択肢BのBatch Transform は非同期一括処理向けでリアルタイム応答には不向きです。 選択肢DのAsync Inference は数十秒以上かかる長時間推論向けのサービスです。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る