あるMLエンジニアがSageMakerでディープラーニングモデルのトレーニングを実行しています。トレーニングジョブは完了しますが、GPU使用率が常に30%以下にとどまり、トレーニング時間が予想より大幅に長くなっています。データローディングのボトルネックが疑われますが、詳細な診断情報を得たいと考えています。最も適切な対処法はどれですか?
正解: SageMaker Debuggerのプロファイラー機能を有効化し、システムメトリクスとフレームワークメトリクスを収集・分析する。 SageMaker Debuggerのプロファイラーは、CPU・GPU・ネットワーク・I/Oなどのシステムメトリクスと、データローディング・前処理・バックワードパスなどのフレームワークレベルのメトリクスを自動収集します。ボトルネック(データローディング待ち・GPUアイドル等)を可視化するProfiler Reportも自動生成されるため、根本原因の特定に最適です。 選択肢Aは、CloudWatchカスタムメトリクスはGPU使用率の記録は可能ですが、フレームワークレベルのデータローディングボトルネックなど詳細な診断情報は得られません。 選択肢Cは、Processing Jobでのデータ前処理はボトルネックの診断ではなく対処であり、詳細な診断情報を得ることはできません。 選択肢Dは、インスタンス変更はボトルネックの原因究明にはならず対症療法にすぎません。