MLAMLワークフローのデプロイとオーケストレーション
あるスタートアップがソーシャルメディア監視向けのセンチメント分析(感情分析)サービスを運営しています。トラフィックパターンは非常に不規則で、大型イベント時には毎分1万リクエストに急増しますが、閑散期には1時間に10リクエスト未満になることもあります。レイテンシ要件は5秒以内です。最もコスト効率の高いデプロイ方法はどれですか?
Aリアルタイムエンドポイントにオートスケーリングを設定し、最小1インスタンス・最大10インスタンスで運用する
オートスケーリング付きリアルタイムエンドポイントは最小1インスタンスが常時稼働するため閑散期もコストが発生します。
BEventBridge のスケジュールで定期的に Batch Transform ジョブをトリガーし、蓄積リクエストを一括処理する
Batch Transform は非同期一括処理向けでリアルタイム応答には不向きです。
CSageMaker Serverless Inference エンドポイントを使用し、リクエストがない間はインスタンスをゼロにスケールダウンしてコストを排除する
✓ 正解
SageMaker Serverless Inference はリクエストがない間はインスタンスを完全に停止(ゼロスケール)するため、閑散期のコストがゼロになります。急増トラフィックも自動スケールで対応でき、5秒以内のレイテンシ要件(コールドスタート込み)も許容範囲内です。
DSageMaker 非同期推論(Async Inference)エンドポイントと SQS キューを組み合わせてリクエストをバッファリングする
Async Inference は数十秒以上かかる長時間推論向けのサービスです。
解説
SageMaker Serverless Inference はリクエストがない間はインスタンスを完全に停止(ゼロスケール)するため、閑散期のコストがゼロになります。急増トラフィックも自動スケールで対応でき、5秒以内のレイテンシ要件(コールドスタート込み)も許容範囲内です。
選択肢Aのオートスケーリング付きリアルタイムエンドポイントは最小1インスタンスが常時稼働するため閑散期もコストが発生します。
選択肢BのBatch Transform は非同期一括処理向けでリアルタイム応答には不向きです。
選択肢DのAsync Inference は数十秒以上かかる長時間推論向けのサービスです。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →