MLAMLソリューションの監視、メンテナンス、セキュリティ
ある動画配信企業が、SageMakerリアルタイムエンドポイントで大規模なTransformerベースの推薦モデルを GPU インスタンス(ml.g5.xlarge)で運用しています。月間の推論コストが高騰しており、レイテンシー要件(p99で50ms以内)を維持したまま、専用ハードウェアによる高スループット・低コスト化を図りたいと考えています。最もコスト効率が高い推論ハードウェアの選択肢はどれですか。
AAWS Inferentia2(ml.inf2)インスタンスにデプロイし、Neuron SDK でモデルをコンパイルして推論する
✓ 正解
推論専用アクセラレータでGPU比のスループット単価が高く、Neuron SDKでTransformerをコンパイルして低レイテンシー・低コスト化できるため、要件のコスト効率と50ms p99に最も合致する。
BAWS Trainium(ml.trn1)インスタンスにデプロイして推論ワークロードを実行する
Trainiumはトレーニング最適化チップであり、推論専用の効率では Inferentia に劣る。推論コスト削減を主目的とする本ケースでは最適ではない。
Cml.g5.xlarge を ml.p4d.24xlarge に変更してスループットを最大化する
p4dは大規模学習向けの非常に高価なGPUインスタンスで、単一推論ワークロードに用いるとコストが大幅増になり、コスト効率の要件に反する。
DGraviton ベースの ml.c7g インスタンスに変更してCPU推論に切り替える
Graviton CPU推論は軽量モデルでは省コストだが、大規模Transformerの低レイテンシー高スループット推論ではアクセラレータに比べ性能が不足しやすい。
解説
AWS Inferentia2(inf2)は推論専用に設計されたアクセラレータで、GPU 比で高いスループットあたりコスト効率を実現する。
Neuron SDK でモデルをコンパイルすることで Transformer 系モデルを低レイテンシー・低コストで提供でき、GPU からの移行による推論コスト削減の代表的手段である。
選択肢Bの Trainium(trn1)はトレーニング向けに最適化されたチップで、推論専用には Inferentia の方がコスト効率に優れる。
選択肢Cの ml.p4d.24xlarge は大規模トレーニング向けの高価なGPUインスタンスで、単一モデル推論ではコストが大幅に増加する。
選択肢Dの Graviton(c7g)はCPU推論で省コストだが、大規模Transformerの低レイテンシー推論ではアクセラレータに比べスループットが不足しやすい。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →