ある不動産会社が賃貸申込の審査を行うMLモデルを開発しています。法的コンプライアンスのため、モデルには人種・民族・出身国などの保護属性を特徴量として含めていません。しかし外部監査で、モデルが特定の人種グループに対して統計的に不利な審査結果を継続的に出していることが判明しました。この問題が発生している最も可能性の高い原因はどれですか?
これは「プロキシ差別(Proxy Discrimination)」と呼ばれる問題です。保護属性を直接除外しても、それと統計的に相関する他の変数(プロキシ変数)を通じて間接的な差別が起きる現象です。例えば郵便番号は特定の地域の人種・民族構成と強く相関することがあり、保護属性の代替情報として機能してしまいます。責任あるAIではプロキシ変数の特定とその影響評価が重要です。 選択肢A のトレーニングデータが少なく、モデルの汎化性能が低下しているケースは汎化性能の問題であり、特定グループへの偏った判断パターンの直接原因にはなりません。 選択肢C のハイパーパラメータのチューニングが不足し、過学習が発生しているケースは精度・過学習に関する問題で差別的パターンとは無関係です。 選択肢D のクロスバリデーションを実施していないため、評価指標が実データを正確に反映していないケースは評価手法の問題であり、プロキシ差別の発生原因にはなりません。