データサイエンティストが訓練したメール迷惑メール分類モデルは、訓練データに対して99%の精度を達成しましたが、本番環境の新しいメールデータに対しては61%の精度しか得られませんでした。この問題を最も正確に説明しているものと、その有効な対策の組み合わせはどれですか?
訓練データで極めて高い精度(99%)を達成する一方、未知データで大幅に精度が低下(61%)している状況はオーバーフィッティングの典型例です。モデルが訓練データのノイズや偶発的パターンを過度に学習し、新しいデータへの汎化能力が失われています。対策としてはL1/L2正則化(重みの抑制)、ドロップアウト(ニューラルネットワーク向け)、早期終了(Early Stopping)、クロスバリデーション、訓練データの増量などが有効です。 選択肢Aのアンダーフィッティングは訓練データでも精度が低くなる現象であり、99%という高い訓練精度と矛盾するため該当しません。 選択肢Cのデータドリフトは本番環境でデータの統計的分布が時間経過とともに変化する現象であり、展開直後の静的な精度差の説明としては不適切です。 選択肢Dのラベルノイズはラベルの誤りにより訓練精度自体も低下する傾向があり、99%という高精度と矛盾します。