Amazon Bedrockでカスタムモデルのファインチューニングジョブを実行中に、MLエンジニアがAmazon CloudWatchのログを確認したところ、トレーニング損失(training loss)はエポックごとに2.4→1.8→1.2→0.6と順調に低下している一方、バリデーション損失(validation loss)はエポックごとに2.3→1.7→1.4→1.9と途中から上昇し始めていることが確認されました。この状況への最も適切な対応はどれですか?
training lossが低下し続ける一方でvalidation lossが上昇する現象は過学習(overfitting)の典型的なサインです。モデルがトレーニングデータに過度に特化して汎化能力を失っています。対処法は(1)validation lossが最小のエポックで早期停止、(2)エポック数削減での再実行、(3)トレーニングデータの増量です。training lossのみ追跡してエポックを増やし続けることは過学習を悪化させます。 選択肢Aのtraining lossが下がり続けているというアプローチは誤りです。training lossのみ追跡してエポックを増やし続けることは過学習を悪化させます。 選択肢Cのデータ再サンプリングは誤りです。validation lossの上昇は必ずしもクラス分布不均衡を示唆しておらず、過学習の典型的なサインです。 選択肢Dのlearning rateを1/10に設定するアプローチは誤りです。validation lossの上昇はlearning rateの不安定性ではなく、過学習(overfitting)を示しており、learning rate調整は根本的な解決になりません。