MLAMLソリューションの監視、メンテナンス、セキュリティ
大手ECサイトが商品検索にBERTベースの埋め込みモデルをSageMakerリアルタイムエンドポイント(ml.g5.2xlarge × 3台)でデプロイしています。P99レイテンシーは85ms以内を維持できていますが、GPU利用料が月次予算の2倍を超えています。レイテンシー要件を維持したままコストを最大60%削減するための最も適切な対応はどれですか。
AAWS Neuron SDKでBERTモデルをコンパイルしml.inf2.xlargeインスタンスに移行し、同等スループットを維持したまま推論コストを削減する
✓ 正解
AWS Neuron SDKによるコンパイルでml.inf2インスタンスへ移行すると、GPU比最大60%のコスト削減とレイテンシー維持が両立できる。BERTなどTransformerモデルはNeuron SDKのネイティブサポート対象であり、SageMakerへの再デプロイも容易。
Bml.g5.2xlargeをml.g4dn.xlargeに変更し、インスタンス台数を5台に増やしてスループット低下を補い月次コストを抑制する
ml.g4dn.xlargeへのダウングレードは単価を下げるが台数を増やすため総コスト削減効果が小さく、旧世代GPUの性能差でP99 85msのレイテンシー要件を満たせないリスクがある。
CSageMaker Serverless Inferenceに移行しメモリ上限と同時実行数を適切に設定してリクエストベースのオンデマンドコストに切り替える
SageMaker Serverless Inferenceはコールドスタートによるレイテンシースパイク(秒単位)が発生するため、P99 85msの厳格なレイテンシー要件を持つリアルタイム検索には不適切。
DSageMaker Batch Transformを使いリクエストをバッファリングして非同期バッチ処理に変換しGPUインスタンスの稼働時間を削減する
SageMaker Batch Transformはファイル単位のオフラインバッチ推論サービスで、リアルタイムのユーザーリクエストに応答するエンドポイントの代替として使用することはできない。
解説
AWS Inferentia(ml.inf2インスタンス)はAmazonが設計したML推論専用アクセラレータで、NVIDIAのGPUと比較して最大40〜60%のコスト削減を実現します。AWS Neuron SDKはPyTorchやHugging Faceと統合されており、BERTなどのTransformerモデルを対象ハードウェア向けにコンパイルすることで、GPU比同等以上のレイテンシーとスループットを達成できます。モデルのコンパイルとSageMakerエンドポイントの再デプロイという最小の手順で移行が完了するため、P99 85ms以内の要件を維持しながら大幅なコスト削減が可能です。
選択肢Bのml.g4dn.xlargeはg5より旧世代GPUインスタンスへのダウングレードであり、台数を増やすため総コスト削減幅が限定的で、レイテンシー要件を維持できない可能性がある。
選択肢CのSageMaker Serverless Inferenceはコールドスタート時に数秒のレイテンシースパイクが発生するため、P99 85msのリアルタイム要件を常時満たすことが困難であり、常時トラフィックがある場合はオンデマンドより高コストになることもある。
選択肢DのSageMaker Batch Transformはオフラインバッチ処理専用サービスであり、ユーザーへのリアルタイム検索応答を返すエンドポイントの代替にはならない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →