AIFAIとMLの基礎
機械学習プロジェクトにおいて、トレーニングデータが実世界のデータ分布を適切に代表していない場合(例:特定の人口統計グループのサンプル数が著しく少ない)、モデルが引き起こす可能性が最も高い問題はどれか?
A過学習(オーバーフィッティング)— モデルが訓練データに過度に適合して汎化性能が低下する現象
モデルが訓練データに過度に適合して汎化性能が低下する現象です。これはモデル複雑度とトレーニングデータ量のバランスに関する問題で、トレーニングデータの偏りによる不公平性とは別の課題です。
Bアルゴリズムバイアス — データの偏りを学習したモデルが特定のグループに対して不公平または不正確な予測を生成する問題
✓ 正解
トレーニングデータの偏りがモデルに学習され、特定グループに対して不公平または不正確な予測が生成される重大な問題です。責任あるAI観点で課題であり、Amazon SageMaker ClarifyでバイアスをDetectできます。
C次元の呪い(Curse of Dimensionality)— 特徴量の次元数が増えるほど学習に必要なデータ量が指数的に増加する現象
特徴量の次元数が増えるほど学習に必要なデータ量が指数的に増加する現象です。高次元データセットにおける課題であり、トレーニングデータの偏りとは全く異なる問題です。
D壊滅的忘却(Catastrophic Forgetting)— ニューラルネットワークが新しいタスクを学習すると以前のタスクの知識が失われる現象
ニューラルネットワークが新しいタスク学習時に以前のタスク知識が失われる現象です。継続学習における課題であり、トレーニングデータの偏りとは無関係です。
解説
トレーニングデータの偏りはアルゴリズムバイアスを引き起こし、特定グループへの不公平な予測につながります。責任あるAIの観点で重大な問題であり、AWSではAmazon SageMaker Clarifyを使ってデータとモデルのバイアスを検出・可視化できます。
選択肢Aの過学習(オーバーフィッティング)はモデルが訓練データに過度に適合して汎化性能が低下する現象であり、データの偏りによる特定グループへの不公平な予測とは原因も影響も異なります。
選択肢Cの次元の呪いは特徴量の次元数が増えることで学習に必要なデータ量が指数的に増加する問題であり、トレーニングデータの偏りが特定グループの予測に与える影響とは直接関係ありません。
選択肢Dの壊滅的忘却はニューラルネットワークの継続学習(逐次学習)における課題であり、トレーニングデータの偏りとは無関係です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →