MLAMLワークフローのデプロイとオーケストレーション
スタートアップ企業がSageMakerでテキスト分類モデルを提供しようとしている。推論リクエストは1日に数回〜数百回と変動が激しく、常時稼働インスタンスの維持コストを避けたい。許容レイテンシーは5秒以内、モデルサイズは1.5GB。インフラ管理負荷を最小にしながらコスト効率を最大化する推論オプションを選択せよ。
Aml.t3.mediumインスタンスのSageMakerリアルタイムエンドポイントを常時稼働させ最低コストのインスタンスで運用する
ml.t3.mediumの常時稼働エンドポイントはリクエストが少ない時間帯もインスタンスコストが継続的に発生し、コスト効率が悪い。
BSageMaker 非同期推論エンドポイントにAuto Scalingを設定してインスタンス数を0に下限スケールインさせる
SageMaker 非同期推論エンドポイントはスケールイン0をサポートするが、Auto Scaling設定が必要でServerlessより運用負荷が高い。
CSageMaker Serverless Inferenceをデプロイして使用時のみ課金し、スケーリングをAWSに委任する
✓ 正解
SageMaker Serverless Inferenceはアイドル時のコストゼロ・自動スケールで断続的トラフィックに最適な管理不要の推論オプション。
DLambdaコンテナイメージにモデルを組み込んで1.5GBのモデルをメモリ10GBのLambda関数として実行する
AWS LambdaはSageMakerと比べてMLモデル専用の最適化機能がなく、コールドスタートによるレイテンシー増加のリスクもある。
解説
SageMaker Serverless Inferenceはリクエストがない間はコストが発生せず、AWSがスケーリングを自動管理する。断続的・低頻度トラフィックで常時稼働コストを避けたいユースケースに最適。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →