MLAMLソリューションの監視、メンテナンス、セキュリティ
規制業界の企業が SageMaker Pipelines でモデル開発・運用を行っています。監査対応として以下をすべて遡れる仕組みが必要です。
- 特定の本番モデルのトレーニングに使用したデータセット
- どの前処理ジョブを経由したか
- どの実験から選定されたか
開発チームの手動記録作業を最小化しながら実現する最も適切な方法はどれですか?
ASageMaker ML Lineage Tracking を活用し、パイプライン実行時にデータセット・処理ジョブ・モデル・エンドポイント間の関係を自動記録させる
✓ 正解
SageMaker ML Lineage Tracking は SageMaker Pipelines 実行時にデータセット・処理ジョブ・モデル・エンドポイントの関係を自動でグラフ記録します。手動操作不要で完全な系譜が保存されるため、監査対応を最小コストで実現できます。
BSageMaker Experiments に各パイプラインステップの入出力アーティファクトを手動ログし、モデル選定時に実験 ID を Model Registry のメタデータに手動記録する
SageMaker Experiments は実験メトリクスの追跡ツールであり、パイプライン全ステップのアーティファクト関係を自動キャプチャする機能はありません。手動ログは記録漏れのリスクがあり、網羅的な監査対応には不向きです。
CAWS Glue Data Catalog にデータセットバージョンを登録し、DynamoDB テーブルでパイプライン実行ごとのデータ・ジョブ・モデルの対応関係をカスタム管理する
Glue Data Catalog と DynamoDB を組み合わせたカスタム実装はパイプラインステップごとの記録ロジックを独自開発する必要があり、開発・運用コストが高く SageMaker ネイティブ機能より保守性で劣ります。
DSageMaker Model Registry の各モデルバージョンにデータセット S3 URI と前処理ジョブ ID を手動入力するフィールドを設け、承認ワークフローで記入を必須化する
Model Registry への手動入力は人的ミスや記入漏れが発生しやすく、手動作業を最小化するという要件を満たしません。また前処理ジョブを含む多段階の系譜を構造的に自動記録する機能も持ちません。
解説
SageMaker ML Lineage Tracking はデータセット・処理ジョブ・トレーニングジョブ・モデル・エンドポイントなどの SageMaker アーティファクト間の関係を自動でグラフ構造に記録するサービスです。SageMaker Pipelines と組み合わせると、パイプライン実行ごとに入力データセット・変換ステップ・出力モデルの完全な系譜が自動キャプチャされます。API を通じて特定エンドポイントから遡ってトレーニングデータまでの全リネージを照会でき、開発者が手動でメタデータを管理する必要はありません。
選択肢Bの SageMaker Experiments は手動ログが前提であり、パイプライン全体のリネージを自動記録する仕組みを持たないため、監査対応での抜け漏れリスクが生じます。
選択肢Cの Glue Data Catalog + DynamoDB の組み合わせはカスタム実装が必要で開発・運用コストが高く、SageMaker ネイティブのリネージ機能と比べて保守性で劣ります。
選択肢Dの Model Registry への手動入力は人的ミスや記入漏れのリスクがあり、「手動作業を最小化する」という要件を満たしません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →