AIFAIとMLの基礎
あるデータサイエンティストが構築した顧客離反予測モデルは、訓練データに対して99%の精度を達成したが、本番環境の新しいデータに対しては63%の精度しか出なかった。この状況を説明する最も適切な機械学習の概念はどれか?
A過小適合(アンダーフィッティング)— モデルが単純すぎて訓練データのパターンも十分に学習できていない状態
過小適合はモデルが単純すぎて訓練データのパターンも十分に学習できていない状態です。訓練精度も低いため、本問の訓練精度は高いが推測精度が著しく低いという現象とは異なります。
B過学習(オーバーフィッティング)— モデルが訓練データに過度に適合し、未知のデータへの汎化性能が低下した状態
✓ 正解
過学習はモデルが訓練データに過度に適合し、ノイズや細部まで記憶することで、新データへの汎化能力が失われた状態です。訓練精度は高くテスト精度が著しく低い場合に発生し、本問の現象と合致します。
Cデータドリフト — 本番環境のデータ分布が訓練時のデータ分布と大きく乖離した状態
データドリフトは本番環境のデータ分布が訓練時と乖離した状態で、時間経過による分布変化であり本問とは別の問題です。
Dクラス不均衡 — 訓練データ内の正例と負例の件数比率が極端に偏っている状態
クラス不均衡は訓練データ内の正例と負例の比率が偏った状態で、モデル過学習とは異なる現象です。
解説
過学習(オーバーフィッティング)は、モデルが訓練データのノイズや細部まで記憶しすぎ、新しいデータへの汎化能力が失われた状態です。訓練精度は高くテスト精度が著しく低い場合に発生します。対策として正則化・ドロップアウト・早期停止・データ拡充などがあります。
選択肢Aの過小適合(アンダーフィッティング)は、モデルが単純すぎて訓練データのパターンすら学習できていない状態であり、訓練精度・テスト精度ともに低くなります。本問では訓練精度99%と高いため該当しません。
選択肢Cのデータドリフトは、本番環境のデータ分布が時間経過などにより訓練時と乖離した状態です。モデル設計上の問題である過学習とは原因が異なります。
選択肢Dのクラス不均衡は、訓練データの正例・負例の比率が極端に偏っている問題です。精度指標の解釈に影響しますが、訓練・本番間の精度乖離の主因とはなりません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →