無限ノック › MLA 練習問題一覧 › 問題
MLAMLワークフローのデプロイとオーケストレーション

大手小売企業のMLエンジニアが、SageMakerリアルタイム推論エンドポイントを本番環境で運用しています。平常時は最小インスタンス数で十分ですが、週末や特売セールの時期にはリクエスト数が最大20倍に急増します。コストを最小化しながらトラフィック急増時に自動でスケールアウトするシステムを構築するための正しいアプローチはどれですか?

A
SageMakerエンドポイントのProductionVariant設定にMaxInstanceCountパラメータを指定するだけで、追加の設定なしにSageMakerがトラフィックに応じてインスタンスを自動的にスケールアウト・スケールインさせる
MaxInstanceCountはApplication Auto Scaling登録時のスケーラブルターゲットの上限として設定するもので、ProductionVariant設定単独でSageMakerが自動スケールする仕組みは存在しません。別途Auto Scaling設定が必要です。
B
AWS Application Auto Scalingを使用してエンドポイントバリアントをスケーラブルターゲットとして登録し、SageMakerVariantInvocationsPerInstanceメトリクスに基づくターゲット追跡スケーリングポリシーを設定する
✓ 正解
リアルタイム推論のオートスケーリングはApplication Auto Scalingで実現します。バリアントをスケーラブルターゲットに登録し、SageMakerVariantInvocationsPerInstanceを基準にターゲット追跡することで自動増減します。
C
Invocationsメトリクスのしきい値超過でCloudWatchアラームがトリガーされたときにAWS Lambda関数を実行し、SageMaker UpdateEndpoint APIを呼び出してエンドポイントのインスタンス数を動的に増減させる
Lambda+UpdateEndpoint方式は技術的に可能ですが、しきい値設計・Lambda保守・更新時のスケーリング遅延など運用負荷が高く、標準機能のApplication Auto Scalingを使う方が適切です。
D
SageMaker Serverless Inferenceに移行してプロビジョニング済みインスタンスを廃止することで、トラフィック量に応じたスケーリングとキャパシティ管理をAWSに完全に委ねる
Serverless Inferenceはコールドスタートレイテンシが生じ大規模・厳格SLAの本番には不向きで、既存リアルタイムエンドポイントからの移行は全体的な再設計を伴うため要件に合いません。

解説

SageMakerリアルタイム推論エンドポイントのオートスケーリングはAWS Application Auto Scalingを通じて設定します。エンドポイントバリアントをスケーラブルターゲットとして登録し、SageMakerVariantInvocationsPerInstance(インスタンスあたりの呼び出し数)をターゲット追跡の基準メトリクスに使うスケーリングポリシーを設定します。これにより、トラフィック増加時にインスタンスが自動追加され、減少時には自動縮退されます。 選択肢AのMaxInstanceCountパラメータは、SageMakerエンドポイントのProductionVariant設定に単独のスケーリング制御パラメータとして存在しません。スケーリングはApplication Auto Scalingで別途設定が必要です。 選択肢CのLambda+UpdateEndpoint方式は、技術的に可能ですが、アラームのしきい値設定・Lambda管理・スケーリング遅延など運用負荷が高く、Application Auto Scalingの標準機能を使う方が適切です。 選択肢DのServerless Inferenceは、コールドスタートレイテンシが発生するため、大規模トラフィックや厳格なSLAがある本番ユースケースには不向きです。また既存リアルタイムエンドポイントからの移行は全体的な再設計を必要とします。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る