MLAMLモデルの開発
保険会社のデータサイエンスチームが、自動車保険料を予測する回帰モデルを構築しています。チームのMLスキルは初中級レベルで、以下の要件を満たす必要があります。
・複数のMLアルゴリズム候補を自動的に試して最適なモデルを特定すること
・実施された前処理・特徴量エンジニアリング手順をPythonコードとして確認・再利用できること
・予測に最も影響を与えた特徴量をレポートとして出力し、規制当局に提示できること
上記要件を最小限の手動作業で満たす方法はどれですか?
ASageMaker Autopilotでトレーニングジョブを実行し、生成されたデータ探索ノートブックとモデル候補ノートブックを確認後、Explainabilityレポートを取得する
✓ 正解
SageMaker Autopilotはテーブルデータ向けのAutoMLサービスで、アルゴリズム選択・前処理・特徴量エンジニアリングを自動化し、Pythonノートブックとして処理パイプラインを出力する。ClarifyベースのExplainabilityレポートでSHAP値も自動生成するため、全要件を最小限の手動作業で満たせる。
BSageMaker Hyperparameter Tuningで同一データセット上のXGBoostとLinear Learnerを並列最適化し、両モデルのSHAP重要度をSageMaker Clarifyで算出して比較する
SageMaker Hyperparameter Tuningは事前に指定したアルゴリズムのパラメータ空間を自動探索するサービスであり、複数アルゴリズムを自動選択する機能や前処理パイプラインを自動生成する機能を持たない。複数アルゴリズムを試すには別途手動でジョブを作成する必要がある。
CSageMaker Canvasでノーコード操作によりモデルを自動選択し、組み込みの特徴量重要度レポートで各変数の予測への影響を確認してエンジニアチームに共有する
SageMaker Canvasはビジネスアナリスト向けノーコードAutoMLツールで、モデル自動選択と特徴量重要度確認は可能だが、前処理・モデルパイプラインをPythonコードとしてエクスポートしてエンジニアが再利用できる機能を提供していない点が要件を満たさない。
DSageMaker Experimentsで複数アルゴリズムの実験をトラッキングし、最良モデルに対してSageMaker Clarifyの説明可能性解析を別途実施する
SageMaker Experimentsは実験メタデータ・メトリクス・アーティファクトのトラッキングサービスであり、アルゴリズムの自動選択や前処理パイプラインの自動生成を行わない。複数アルゴリズムを試す作業は手動で実施する必要があり、最小限の手動作業という要件を満たさない。
解説
SageMaker Autopilotは、テーブルデータに対してアルゴリズム選択・前処理・特徴量エンジニアリング・ハイパーパラメータ最適化をエンドツーエンドで自動化するAutoMLサービスです。
Autopilotが自動生成する主なアーティファクトは以下の2種類です。
①データ探索ノートブック:データ分析・前処理・特徴量エンジニアリング処理のPythonコードを含む
②モデル候補ノートブック:各候補アルゴリズムのトレーニングパイプラインコードを含む
これにより「前処理手順をPythonコードで確認・再利用できる」要件を満たします。さらにSageMaker ClarifyをベースにしたExplainabilityレポートを自動生成してSHAP値による特徴量重要度を出力するため、規制対応要件も1つのサービスで一括して満たせます。
選択肢BのSageMaker Hyperparameter Tuningは、事前にアルゴリズムを指定した上でハイパーパラメータ空間のみを自動探索するサービスであり、複数アルゴリズムの自動選択や前処理パイプラインの自動生成機能を持ちません。
選択肢CのSageMaker Canvasはビジネスアナリスト向けのノーコードAutoMLツールで、特徴量重要度の確認は可能ですが、前処理・モデル選択パイプラインをPythonコードとしてエンジニアが再利用できる形で提供する機能がありません。
選択肢DのSageMaker Experimentsは実験メタデータ・メトリクス・アーティファクトのトラッキングサービスであり、アルゴリズムの自動選択や前処理パイプラインの自動生成は行わないため、複数アルゴリズムを試す作業は依然として手動が必要です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →