MLAMLワークフローのデプロイとオーケストレーション

自然言語処理モデル(パラメータ数2億)をSageMakerでリアルタイム推論エンドポイントとして本番運用している。現在p3.2xlargeインスタンスを使用しており、1日1億件のリクエストに対しGPU利用コストが予算を超過している。推論レイテンシー100ms以内を維持しながら推論コストを最大限削減するインスタンス選択はどれか。

A
g5.xlargeインスタンスに移行してNVIDIA TensorRTでモデルを最適化しGPUスループット対コストを改善する
g5.xlargeはA10G GPUを搭載しp3より高性能だが、GPU自体のコスト削減には直接つながらずInferentiaより割高になる。
B
SageMaker Serverless Inferenceに移行してアイドル時の課金をゼロにし高頻度スパイクに自動対応する
SageMaker Serverless Inferenceは1日1億件の高頻度リクエストには不向きで、継続的な高スループットではインスタンス課金の方がコスト効率がよい。
C
ml.c5.9xlargeのCPUインスタンスにONNX形式でモデルを変換してデプロイしGPUコストを排除する
ml.c5.9xlargeはCPUインスタンスであり、2億パラメータのNLPモデルでは100msレイテンシー要件を安定して満たすことが難しい。
D
inf1インスタンスにNeuron SDKでコンパイルしたモデルをデプロイし、GPU比で大幅なコスト削減を実現する
✓ 正解
inf1インスタンスはAWS Inferentiaチップ搭載でML推論に特化しており、同等レイテンシーでGPU比最大70%のコスト削減が可能。

解説

AWS Inferentia(inf1/inf2)はML推論専用チップを搭載したインスタンスで、GPUインスタンス比で最大70%のコスト削減が可能。Neuron SDKでモデルをコンパイルしSageMakerエンドポイントにデプロイする。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る