MLA機械学習のためのデータ準備

金融機関がローン審査モデルを開発しています。トレーニング前に、学習データの特徴量「年齢」に関するバイアスを定量的に評価したいと考えています。Amazon SageMaker Clarify を使用して前処理バイアス(Pre-training bias)を測定する際、保護属性グループ(年齢層)間でのクラスラベル(承認/否決)の分布不均衡を検出するために最も適切な指標はどれか。

A
SHAP値(SHapley Additive exPlanations:各特徴量の予測への貢献度を定量化する指標)
SHAPはトレーニング後の個別予測の説明性(Post-training explainability)に使用するため不適切です。
B
CI(Class Imbalance:クラス不均衡)
✓ 正解
SageMaker Clarify の Pre-training bias metrics において、CI(Class Imbalance)はファセット(保護属性グループ、例:年齢層)ごとのクラスラベル分布の偏りをトレーニング前に定量化します。
C
NDCG(Normalized Discounted Cumulative Gain:検索・推薦システムのランキング品質を評価する指標)
NDCGはランキングシステムの評価指標であり、バイアス測定とは無関係です。
D
KL ダイバージェンス(Kullback-Leibler divergence:2つの確率分布間の差異を測る情報理論的指標)
KLダイバージェンスはSageMaker Clarifyの前処理バイアス指標の一つですが、2つの確率分布間のKL距離を計算するものであり、ファセット間のクラスラベル表現の不均衡そのものを直接的に定量化するCI(Class Imbalance)の方が本問の要件(承認/否決の分布不均衡の検出)に最も適しています。

解説

SageMaker Clarify の Pre-training bias metrics において、CI(Class Imbalance)はファセット(保護属性グループ、例:年齢層)ごとのクラスラベル分布の偏りをトレーニング前に定量化します。 選択肢AのSHAPはトレーニング後の個別予測の説明性(Post-training explainability)に使用するため不適切です。 選択肢CのNDCGはランキングシステムの評価指標であり、バイアス測定とは無関係です。 選択肢DのKLダイバージェンスはSageMaker Clarifyの前処理バイアス指標の一つですが、2つの確率分布間のKL距離を計算するものであり、ファセット間のクラスラベル表現の不均衡そのものを直接的に定量化するCI(Class Imbalance)の方が本問の要件(承認/否決の分布不均衡の検出)に最も適しています。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る