MLAMLモデルの開発

金融機関のデータサイエンティストが、貸付審査モデルを構築する前に、トレーニングデータセットに性別・年齢などのセンシティブ属性に基づくバイアスが含まれていないか定量的に測定したいと考えています。Amazon SageMaker Clarifyのトレーニング前バイアス(Pre-training Bias)分析を実行する際、センシティブ属性グループ間のサンプル数の偏りを測定するメトリクスはどれですか?

A
SHAP値(SHapley Additive exPlanations:シャープリー値に基づく各特徴量の予測貢献度を示す説明可能性の指標)
SHAP値はポストトレーニング段階でモデルの予測に各特徴量がどれだけ寄与しているかを示す説明可能性(Explainability)の指標であり、Pre-training Biasの測定には使用しません。
B
CI(Class Imbalance:クラス不均衡度)
✓ 正解
SageMaker ClarifyのPre-training Bias分析において、CI(Class Imbalance)はセンシティブ属性のグループ間におけるサンプル数の偏りを測定します。例えば女性より男性のサンプルが著しく多い場合にCIが高い値となります。
C
NDCG(Normalized Discounted Cumulative Gain:正規化割引累積利得、情報検索におけるランキング品質の指標)
NDCGはランキングシステム評価の指標です。
D
RMSE(Root Mean Square Error:二乗平均平方根誤差、回帰モデルの予測誤差の指標)
RMSEは回帰誤差の指標です。

解説

SageMaker ClarifyのPre-training Bias分析において、CI(Class Imbalance)はセンシティブ属性のグループ間におけるサンプル数の偏りを測定します。例えば女性より男性のサンプルが著しく多い場合にCIが高い値となります。 選択肢AのSHAP値はポストトレーニング段階でモデルの予測に各特徴量がどれだけ寄与しているかを示す説明可能性(Explainability)の指標であり、Pre-training Biasの測定には使用しません。 選択肢CのNDCGはランキングシステム評価の指標です。 選択肢DのRMSEは回帰誤差の指標です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る