MLAMLワークフローのデプロイとオーケストレーション
製造業の企業が、工場内の数千台のNVIDIA Jetsonエッジデバイスに物体検出モデルをデプロイしようとしています。モデルはSageMaker上でPyTorchを使用してトレーニングされましたが、エッジデバイスのメモリとコンピューティングリソースは限られています。エッジデバイスへのモデル最適化と集中管理を同時に実現するために使用すべきサービスの組み合わせはどれですか?
ASageMaker Neoを使用してNVIDIA Jetson向けにモデルをコンパイル・最適化し、AWS IoT Greengrassを使用してエッジデバイスにデプロイ・管理する
✓ 正解
SageMaker NeoはPyTorch等のモデルをNVIDIA Jetson向けにコンパイル・最適化し、限られたリソースでも高速推論を実現します。AWS IoT Greengrassがエッジへのデプロイ・バージョン管理・指標収集を一元管理し、最適化と集中管理の両立に最適です。
BAmazon ElastiCacheをエッジにキャッシュレイヤーとして配置し、推論リクエストをキャッシュすることでリソース制約を回避する
ElastiCacheはインメモリキャッシュサービスであり、エッジでのモデルコンパイルや軽量化、集中管理の機能を持ちません。推論キャッシュではエッジデバイスのメモリ・コンピューティング制約そのものを解決できず、要件を満たしません。
CSageMaker Batch Transformでモデルアーティファクトを生成し、SageMaker Edge Manager(2024年4月にサービス終了)でエッジデバイスにデプロイ・管理する
SageMaker Batch Transformはクラウド上のバッチ推論サービスでエッジ向けモデルコンパイルには使えません。加えてSageMaker Edge Managerは2024年4月にサービス終了しており、この組み合わせは現行構成として不適切です。
DSageMaker Serverless Inferenceをオートスケールで構成し、エッジデバイスからのリクエストをクラウド上の推論エンドポイントに集約する
Serverless Inferenceはクラウド上の推論エンドポイントであり、リクエストをクラウドに集約する構成です。ネットワーク非接続や低遅延が求められるエッジ推論には不適で、デバイス側のリソース制約も解決できません。
解説
SageMaker Neoは、PyTorch・TensorFlowなどで作成されたモデルを特定のハードウェアターゲット(NVIDIA Jetsonを含む)向けにコンパイルし、ランタイム最適化により限られたメモリ・コンピューティングリソースでも高速推論を実現します。AWS IoT Greengrassは、コンパイル済みモデルのエッジデバイスへのデプロイ・バージョン管理・パフォーマンス指標の収集をクラウドから一元管理します。
なお、SageMaker Edge Managerは2024年4月にサービス終了となり、現在はIoT Greengrassとの組み合わせが推奨アーキテクチャです。
選択肢BのElastiCacheはインメモリキャッシュサービスであり、モデル最適化・管理には使用しません。
選択肢CのSageMaker Batch Transformはバッチ推論サービスであり、エッジ向けのモデルコンパイルには使用できません(SageMaker Edge Managerも終了済み)。
選択肢DのServerless Inferenceはクラウドサービスであり、ネットワーク非接続環境のエッジには不適切です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →