MLAMLソリューションの監視、メンテナンス、セキュリティ複数選択
ECサイトの需要予測モデルが SageMaker リアルタイムエンドポイントで稼働しています。毎週末にモデルの予測精度(MAPE:平均絶対パーセント誤差)が急激に悪化するパターンが確認されました。ML エンジニアは、精度が事前定義のしきい値を下回ったときに自動で再トレーニングをトリガーする完全サーバーレスな仕組みを構築したいと考えています。最もスケーラブルな実装として正しい組み合わせを2つ選んでください。
A推論アプリケーションから MAPE を CloudWatch カスタムメトリクスとして定期送信し、CloudWatch アラームでしきい値を監視する
✓ 正解
完全サーバーレスな自動再トレーニングは、①推論アプリが MAPE(Mean Absolute Percentage Error:予測誤差の割合を示す指標)を CloudWatch カスタムメトリクスに送信し、②CloudWatch アラームがしきい値超過を検知、③EventBridge ルールが SageMaker Pipelines の再トレーニングパイプラインをトリガーする構成で実現します。
BEC2 インスタンス上の cron ジョブで MAPE を計算し、しきい値を下回ったら手動で SageMaker Training Job を起動する
EC2 管理 は、EC2 上の cron ジョブで MAPE を計算し手動で SageMaker Training Job を起動するため、非サーバーレスであり自動化されていません。
CCloudWatch アラーム発火時に EventBridge ルールをトリガーとして SageMaker Pipelines の再トレーニングパイプラインを自動起動する
✓ 正解
完全サーバーレスな自動再トレーニングは、①推論アプリが MAPE(Mean Absolute Percentage Error:予測誤差の割合を示す指標)を CloudWatch カスタムメトリクスに送信し、②CloudWatch アラームがしきい値超過を検知、③EventBridge ルールが SageMaker Pipelines の再トレーニングパイプラインをトリガーする構成で実現します。
DAWS Batch ジョブで毎日全データを再学習して常に最新モデルをデプロイすることでドリフトを予防する
AWS Batch ジョブ は、精度劣化とは無関係に毎日再トレーニングするためコスト非効率です。
ESageMaker Model Monitor のモデル品質監視ジョブを設定して MAPE 劣化を検知し、Amazon SNS 経由で ML エンジニアへ通知して手動で再トレーニングをトリガーさせる
SageMaker Model Monitor を使った通知→手動トリガーは自動化されておらず、完全サーバーレスな自動再トレーニングの要件を満たしません。
解説
完全サーバーレスな自動再トレーニングは、選択肢Aと選択肢Cを組み合わせることで実現します。
選択肢Aは、推論アプリが MAPE(Mean Absolute Percentage Error:予測誤差の割合を示す指標)を CloudWatch カスタムメトリクスとして定期送信し、CloudWatch アラームがしきい値超過を検知する構成で正しい選択です。
選択肢Bは、EC2 上の cron ジョブで MAPE を計算し手動で SageMaker Training Job を起動するため、非サーバーレスであり自動化されていません。
選択肢Cは、CloudWatch アラーム発火時に EventBridge ルールが SageMaker Pipelines の再トレーニングパイプラインを自動起動する構成で正しい選択です。
選択肢Dは、精度劣化とは無関係に毎日全データを再学習するためコスト非効率であり、条件ベースの自動再トレーニングという要件を満たしません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →