ある機械学習エンジニアが不正検知モデルを構築しました。同じデータセットを分割したトレーニングセットでの正解率は98%でしたが、テストセットでの正解率は71%でした。このモデルが抱えている問題として最も適切な診断はどれですか?
正解: 過剰適合(オーバーフィッティング):モデルがトレーニングデータに過度に特化し、未知データへの汎化能力が低い。 トレーニング精度(98%)とテスト精度(71%)の大きな乖離は過剰適合(オーバーフィッティング)の典型的なサインです。モデルがトレーニングデータのノイズや細かいパターンまで「暗記」した結果、未見データへの汎化能力が低下した状態です。対策としては、正則化(L1/L2)、ドロップアウト、早期停止(Early Stopping:検証誤差が改善しなくなった時点で学習を打ち切る手法)、交差検証(Cross-Validation)などが有効です。 選択肢Aは 過少適合(アンダーフィッティング)はトレーニング精度とテスト精度の差異ではなく、全体的な精度が低い状態です。 選択肢Cは データ不均衡(クラスインバランス)は不正検知モデルで考慮すべきですが、98%対71%の大きな差異の主原因ではありません。 選択肢Dは 特徴量エンジニアリングの不足は両精度が低くなるパターンで、トレーニング精度が高い場合は該当しません。