AIFAIとMLの基礎
機械学習チームが画像分類モデルを訓練したところ、訓練データに対する精度は98%でしたが、未知のテストデータに対しては63%しか達成できませんでした。この状況を最もよく説明する概念と、その主な対策の組み合わせとして正しいものはどれですか?
A未学習(Underfitting):モデルを複雑化するか、特徴量を追加する
(未学習): モデルが単純すぎる場合に発生します。
B過学習(Overfitting):正則化・ドロップアウト・学習データの増加などで汎化能力を改善する
✓ 正解
過学習(Overfitting)は、モデルが訓練データのノイズや細部まで記憶し、未知データへの汎化能力が低下する現象です。訓練精度が高くテスト精度が大幅に低い場合が典型です。対策はL1/L2正則化、ドロップアウト、データ拡張、早期停止(Early Stopping)など。
Cデータドリフト(Data Drift):本番データの分布変化を検知するモニタリングを導入する
(データドリフト): 時系列的な分布のずれが原因です。
Dクラス不均衡(Class Imbalance):オーバーサンプリングやクラス重み付けで対処する
(クラス不均衡): 訓練・テスト精度の大きなギャップより、クラス間の偏りが主因となります。
解説
選択肢A(未学習): モデルが単純すぎる場合に発生する現象です。訓練精度・テスト精度がともに低い場合が典型的で、モデルの複雑化や特徴量の追加が対策となります。
選択肢B(過学習): 訓練精度が98%と高い一方でテスト精度が63%と大幅に低い今回のケースが典型的な過学習(Overfitting)です。モデルが訓練データのノイズや細部まで記憶し、未知データへの汎化能力が低下します。対策はL1/L2正則化、ドロップアウト、データ拡張、早期停止(Early Stopping)などです。
選択肢C(データドリフト): 本番環境と訓練時とでデータの分布が時系列的にずれる現象であり、今回のように単一評価での訓練・テスト間の精度差を説明する概念としては不適切です。
選択肢D(クラス不均衡): 特定クラスのサンプル数が極端に少ない場合に生じる問題であり、訓練・テスト精度の大きなギャップの主因にはなりません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →