MLA機械学習のためのデータ準備
金融機関がローン審査モデルを開発しています。モデルのトレーニングを開始する前に、トレーニングデータセット内で特定の人口統計グループ(例:特定の年齢層)が肯定的な結果(ローン承認)に対して不当に少ない割合しか占めていないかを検出したいと考えています。このトレーニング前バイアス(pre-training bias)の検出にSageMaker Clarifyで最も適切なメトリクスはどれですか?
ASHAP(SHapley Additive exPlanations)値:各特徴量がモデル予測に与える寄与度を定量化する手法
SHAP(SHapley Additive exPlanations)はモデルのトレーニング完了後に各特徴量の予測への寄与度を定量化するための説明可能AI手法です。トレーニング前のデータセットにおけるグループ間の結果分布の偏りを検出するメトリクスではありません。
BClass Imbalance(CI):データセット内のファセットグループ間のサンプル数の不均衡を測定する
Class Imbalance(CI)はデータセット内でファセットグループのサンプル数が参照グループと比べて不均衡かどうかを測定します。ただしサンプル数の偏りを測定するものであり、肯定的な結果(ローン承認)の割合がグループ間で偏っているかを直接測定するメトリクスではありません。
CDisparate Impact(DI):参照グループと比較した対象グループの肯定的結果の割合の比を測定する
✓ 正解
Disparate Impact(DI)は対象グループと参照グループ間で肯定的結果の割合の比を測定します。DI < 1 の場合、対象グループが肯定的結果(ローン承認)を不当に少ない割合しか得られていないことを示すため、今回の要件に最も適したトレーニング前バイアス検出メトリクスです。
DConditional Demographic Disparity(CDD):サブグループ条件を加味してグループ間の結果差を測定する
Conditional Demographic Disparity(CDD)は他の変数を条件として制御した上でグループ間の結果差を測定する高度な条件付きメトリクスです。サブグループ条件を加味した分析であり、単純に特定グループの肯定的結果割合の偏りを測定する今回の要件には合致しません。
解説
Disparate Impact(DI)は、対象グループ(ファセット)の肯定的結果の割合を参照グループの割合で割った比率です。DI < 1 の場合、対象グループが肯定的結果に対して不当に少ない割合しか得られていないことを示します。
選択肢AのSHAPはトレーニング後の特徴量重要度の説明に使用されます。
選択肢BのClass Imbalance(CI)はサンプル数の不均衡を測定しますが、肯定的結果の分布の偏りは測定しません。
選択肢DのConditional Demographic Disparity(CDD)は条件付き分析であり、単純な結果比率の偏りとは異なります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →