MLAMLワークフローのデプロイとオーケストレーション
製造業の品質管理チームが、SageMaker上でトレーニングしたPyTorchの画像分類モデルをml.c5.xlargeインスタンスのリアルタイム推論エンドポイントにデプロイしています。現在の平均推論レイテンシは80msですが、生産ラインの要件として50ms以下が必要です。インスタンスタイプをアップグレードせずにレイテンシを改善するための最も効果的なアプローチはどれですか?
ASageMaker Neoでモデルをml.c5.xlargeのCPUアーキテクチャ向けにコンパイル・最適化し、同一インスタンスタイプで再デプロイする
✓ 正解
SageMaker Neoは、機械学習モデルをターゲットのハードウェア(CPU・GPU・エッジデバイスなど)向けにコンパイルして最適化するサービスです。コンパイル後のモデルは同一ハードウェア上でも推論速度が大幅に向上(一般的に25〜100%程度の改善)し、インスタンスのアップグレードなしにレイテンシ要件を達成できる可能性があります。Neoはml.c5系インスタンスのCPUアーキテクチャを最適化ターゲットとして指定できます。
BSageMaker Serverless Inferenceに移行して、インフラ管理をAWSに委任し推論処理を軽量化する
Serverless Inferenceは、トラフィックがゼロの状態からのコールドスタートレイテンシが発生するため、厳格なレイテンシ要件(50ms)を持つ本番ユースケースには不向きです。
CSageMaker マルチモデルエンドポイント(MME)に移行してリソース使用効率を向上させる
マルチモデルエンドポイントは、コスト効率化(複数モデルを1エンドポイントに集約)のための機能であり、単一モデルの推論レイテンシ改善には寄与しません。
DモデルをONNX(Open Neural Network Exchange)形式に変換してS3にアップロードし、既存エンドポイントのモデルを差し替える
ONNX(Open Neural Network Exchange)は、異なるMLフレームワーク間でモデルを共有するための形式であり、変換自体はレイテンシを直接改善しません。NeoはONNXを入力として受け付けますが、最適化するのはNeoのコンパイルステップです。
解説
SageMaker Neoは、機械学習モデルをターゲットのハードウェア(CPU・GPU・エッジデバイスなど)向けにコンパイルして最適化するサービスです。コンパイル後のモデルは同一ハードウェア上でも推論速度が大幅に向上(一般的に25〜100%程度の改善)し、インスタンスのアップグレードなしにレイテンシ要件を達成できる可能性があります。Neoはml.c5系インスタンスのCPUアーキテクチャを最適化ターゲットとして指定できます。
選択肢BのServerless Inferenceは、トラフィックがゼロの状態からのコールドスタートレイテンシが発生するため、厳格なレイテンシ要件(50ms)を持つ本番ユースケースには不向きです。
選択肢Cのマルチモデルエンドポイントは、コスト効率化(複数モデルを1エンドポイントに集約)のための機能であり、単一モデルの推論レイテンシ改善には寄与しません。
選択肢DのONNX(Open Neural Network Exchange)は、異なるMLフレームワーク間でモデルを共有するための形式であり、変換自体はレイテンシを直接改善しません。NeoはONNXを入力として受け付けますが、最適化するのはNeoのコンパイルステップです。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →