MLAMLワークフローのデプロイとオーケストレーション
ある ML エンジニアが画像分類モデルを SageMaker エンドポイントにデプロイしようとしています。ビジネス要件として「p99 レイテンシ 100ms 以内」「インスタンスコストの最小化」が求められていますが、このモデルアーキテクチャに最適なインスタンスタイプの知見がありません。最も効率的にインスタンスタイプを選定する方法はどれですか?
Aml.g4dn 系インスタンスを対象に独自の負荷テストスクリプトを作成し、手動で各インスタンスタイプを検証する
ml.g4dn系インスタンスを対象にした独自の負荷テストスクリプトによる手動検証は、対象インスタンスの選定・環境構築・結果集計をすべて手作業で行う必要があり、Inference Recommenderと比べて大幅に時間とコストがかかります。
BSageMaker Inference Recommender を使用して複数インスタンスタイプに対してロードテストを実行し、レイテンシ要件を満たしつつ最もコスト効率の高いインスタンスタイプを特定する
✓ 正解
SageMaker Inference Recommenderは、モデルを複数のインスタンスタイプで自動的にベンチマークし、スループット・レイテンシ・コストのトレードオフを比較するサービスです。レイテンシ制約を指定することで要件を満たす最安インスタンスを推薦します。
CAWS Cost Explorer でインスタンス単価を比較し、最安値のインスタンスタイプを選択する
AWS Cost Explorerは過去のAWS利用コストの可視化・分析に特化したツールであり、推論レイテンシやスループットなどのパフォーマンス評価機能はありません。コストだけで選択するとp99レイテンシ要件を満たせないリスクがあります。
D画像分類には ml.c5.xlarge が標準的とされているため、そのままデプロイして検証する
画像分類にml.c5.xlargeが「標準的」という事実はなく、CPUインスタンスではGPUインスタンスよりp99レイテンシ要件を満たせない場合があります。適切なインスタンスタイプはモデルアーキテクチャや入力サイズに依存するため、ベンチマークなしで選定するべきではありません。
解説
SageMaker Inference Recommender は、モデルを複数のインスタンスタイプで自動的にベンチマークし、スループット・レイテンシ・コストのトレードオフを比較するサービスです。レイテンシ制約を指定することで要件を満たす最安インスタンスを推薦します。
選択肢Aの ml.g4dn 系インスタンスを対象にした独自の負荷テストスクリプトによる手動検証は、対象インスタンスの選定・環境構築・結果集計をすべて手作業で行う必要があり、Inference Recommender と比べて大幅に時間とコストがかかります。
選択肢Cの AWS Cost Explorer はコスト分析ツールであり、ML 推論のレイテンシやスループットの評価には使用できません。
選択肢Dの 画像分類に ml.c5.xlarge が「標準的」という事実はなく、CPU インスタンスでは GPU インスタンスより p99 レイテンシ要件を満たせない場合があります。適切なインスタンスタイプはモデルアーキテクチャや入力サイズに依存するため、ベンチマークなしで選定するべきではありません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →