あるデータサイエンティストが Amazon SageMaker で深層学習モデルのトレーニングジョブを実行しています。トレーニング中に損失(Loss)が急激に増大し、パラメータが NaN(非数値)になって学習が不安定になっています。これは勾配爆発(Gradient Explosion)の症状と疑われます。追加コードを最小限に抑えつつ、トレーニング中にリアルタイムで勾配爆発を自動検出し、問題発生時にジョブを自動停止させる最も適切な方法はどれか。
選択肢C(SageMaker Debugger「ExplodingTensor」)は、テンソル(重み・勾配など)の異常な増大をトレーニング中にリアルタイムで検出するビルトインルールです。StopTrainingJob アクションと組み合わせることで問題発生時にジョブを自動停止でき、無駄なコンピューティングコストを削減できます。追加コードを最小限に抑えつつ勾配爆発の検出と自動停止を実現できます。 選択肢A(SageMaker Model Monitor)は本番エンドポイントへの入力データの統計的変化を監視するサービスであり、トレーニング中の勾配検出には使用しません。 選択肢B(「VanishingGradient」)は逆の問題(勾配消失)を検出するルールであり、勾配爆発の検出には適していません。 選択肢D(SageMaker Experiments)はトレーニングメトリクスの記録・比較ツールで、リアルタイムの自動検出・停止機能はありません。