AIF責任あるAIのガイドライン
MLエンジニアが採用候補者を評価するモデルを構築しました。過去10年間の採用データで学習させたところ、モデルが特定の性別・人種グループに対して不利な予測をすることが判明しました。このバイアスの根本原因として最も可能性が高いものはどれですか?
A学習データ自体に過去の採用における人的な偏りが反映されている(データバイアス)
✓ 正解
採用判断の偏りが過去10年分のデータに蓄積されており、モデルがそのパターンを学習することで特定グループへの不公平な予測が生じます。これはデータバイアスの典型的な事例です。
Bモデルのハイパーパラメータ(学習率や隠れ層の深さなどのモデル設定値)の設定が不適切である
学習率や隠れ層の深さなどのハイパーパラメータはモデルの収束速度や表現力に影響しますが、学習データに含まれる人口統計的バイアスの根本原因にはなりません。
C推論時に割り当てるコンピューティングリソースが不足または制限されている
推論時のコンピューティングリソースはモデルの応答速度やスループットに影響しますが、モデルが学習したパターンに基づく予測バイアスとは無関係です。
D使用する基盤モデルのコンテキストウィンドウサイズが処理に対して小さすぎる
コンテキストウィンドウは入力テキストの処理可能な最大長を制限するパラメータであり、採用候補者の属性グループに対する予測の偏りとは直接関係しません。
解説
過去の採用データに特定グループを不利に扱う偏りが含まれている場合、モデルはそのパターンを学習してしまいます。これをデータバイアス(学習前バイアス:Pre-training Bias)と呼びます。Amazon SageMaker Clarify を使用すると定量的にデータバイアスを検出・報告できます。
選択肢Bのモデルのハイパーパラメータはモデル性能の調整に関わりますが、バイアスの根本原因ではありません。
選択肢Cの推論時のコンピューティングリソース不足はモデルの処理速度や応答時間に影響しますが、予測のバイアスとは無関係です。
選択肢Dのモデルのコンテキストウィンドウサイズは入力テキストの長さ制限に関わるものであり、採用における特定グループへのバイアスとは無関係です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →