AIFAIとMLの基礎
あるデータサイエンティストが住宅ローン審査の可否を予測するモデルを構築しました。訓練データでの正解率は69%、テストデータでの正解率は68%です。ビジネス要件は正解率90%以上ですが、両データセットで大きく下回っています。訓練とテストの精度差はわずか1%です。この状況の原因として最も適切な説明はどれですか?
A過学習(Overfitting):モデルが訓練データに過度に適合し、テストデータへの汎化性能が低下している状態
過学習は訓練精度が高くテスト精度が著しく低い大きなギャップが特徴。本問は訓練69%・テスト68%と差が1%しかなく、過学習のパターンに合致しない。
B過小適合(Underfitting):モデルが単純すぎてデータの複雑なパターンを学習しきれていない高バイアス状態
✓ 正解
訓練・テスト両データで精度が低く差も小さい状態は過小適合(高バイアス)の典型パターン。モデルの複雑さの増加や特徴エンジニアリング改善、より強力なアルゴリズムへの変更で対処する。
Cデータリーケージ(Data Leakage):訓練時に本来参照できない将来情報がモデルに混入している状態
データリーケージは将来情報の混入で訓練精度が異常に高くなる現象。本問の訓練精度69%は低水準であり、データリーケージが主因である可能性は低い。
Dクラス不均衡(Class Imbalance):承認・否決のサンプル数の偏りが正解率の評価を歪めている状態
クラス不均衡はAccuracyが誤解を招く場合に問題となるが、訓練・テスト両方で低精度かつ差も小さい本問の主因はモデルの表現力不足(過小適合)であり、クラス不均衡は主な原因ではない。
解説
過小適合(Underfitting)は高バイアス状態とも呼ばれ、モデルの表現力が不足しているため訓練データのパターンすら十分に学習できていない状態です。訓練・テスト両方で精度が低く、かつ両者の差が小さいのが典型的な特徴です。対策としてはモデルの複雑さを増す、特徴エンジニアリングを改善する、より強力なアルゴリズムに変更するなどが有効です。
選択肢Aの過学習は訓練精度が高くテスト精度が著しく低い「大きなギャップ」が特徴です。本問は訓練69%・テスト68%と差がわずか1%のため、過学習のパターンには当てはまりません。
選択肢Cのデータリーケージは将来情報の混入により訓練精度が非現実的に高くなる現象です。訓練精度69%は低く、この原因とは考えにくい状況です。
選択肢Dのクラス不均衡はAccuracyが実態を反映しない場合に問題となりますが、訓練・テスト両方で低精度かつ差が小さい本問の主因はモデルの表現力不足です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →