無限ノック › AIF 練習問題一覧 › 問題
AIFAIとMLの基礎

データサイエンティストが訓練したメール迷惑メール分類モデルは、訓練データに対して99%の精度を達成しましたが、本番環境の新しいメールデータに対しては61%の精度しか得られませんでした。この問題を最も正確に説明しているものと、その有効な対策の組み合わせはどれですか?

A
アンダーフィッティング(Underfitting):モデルの表現力が不足しているため、より複雑なモデルを採用するか特徴量を追加する
アンダーフィッティングは訓練データでも精度が低くなる現象であり、99%という高い訓練精度と矛盾するため該当しません。
B
オーバーフィッティング(Overfitting):モデルが訓練データを過度に記憶したため、L1/L2正則化・ドロップアウト・早期終了(Early Stopping)などで汎化性能を改善する
✓ 正解
訓練データで極めて高い精度(99%)を達成する一方、未知データで大幅に精度が低下(61%)している状況はオーバーフィッティングの典型例です。モデルが訓練データのノイズや偶発的パターンを過度に学習し、新しいデータへの汎化能力が失われています。対策としてはL1/L2正則化(重みの抑制)、ドロップアウト(ニューラルネットワーク向け)、早期終了(Early Stopping)、クロスバリデーション、訓練データの増量などが有効です。
C
データドリフト(Data Drift):本番データの統計的分布が変化しているため、Amazon SageMaker Model Monitorで継続監視し定期的に再訓練する
データドリフトは本番環境でデータの統計的分布が時間経過とともに変化する現象であり、展開直後の静的な精度差の説明としては不適切です。
D
ラベルノイズ(Label Noise):訓練データのラベルに誤りが含まれているため、データクリーニングとラベルの見直しを実施する
ラベルノイズはラベルの誤りにより訓練精度自体も低下する傾向があり、99%という高精度と矛盾します。

解説

訓練データで極めて高い精度(99%)を達成する一方、未知データで大幅に精度が低下(61%)している状況はオーバーフィッティングの典型例です。モデルが訓練データのノイズや偶発的パターンを過度に学習し、新しいデータへの汎化能力が失われています。対策としてはL1/L2正則化(重みの抑制)、ドロップアウト(ニューラルネットワーク向け)、早期終了(Early Stopping)、クロスバリデーション、訓練データの増量などが有効です。 選択肢Aのアンダーフィッティングは訓練データでも精度が低くなる現象であり、99%という高い訓練精度と矛盾するため該当しません。 選択肢Cのデータドリフトは本番環境でデータの統計的分布が時間経過とともに変化する現象であり、展開直後の静的な精度差の説明としては不適切です。 選択肢Dのラベルノイズはラベルの誤りにより訓練精度自体も低下する傾向があり、99%という高精度と矛盾します。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る