無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

あるMLエンジニアがSageMakerでディープラーニングモデルのトレーニングを実行しています。トレーニングジョブは完了しますが、GPU使用率が常に30%以下にとどまり、トレーニング時間が予想より大幅に長くなっています。データローディングのボトルネックが疑われますが、詳細な診断情報を得たいと考えています。最も適切な対処法はどれですか?

A
Amazon CloudWatchカスタムメトリクスを使用してGPU使用率を手動で記録し、グラフ化する
CloudWatchカスタムメトリクスはGPU使用率の記録は可能ですが、フレームワークレベルのデータローディングボトルネックなど詳細な診断情報は得られません。
B
SageMaker Debuggerのプロファイラー機能を有効化し、システムメトリクスとフレームワークメトリクスを収集・分析する
✓ 正解
SageMaker Debuggerのプロファイラーは、CPU・GPU・ネットワーク・I/Oなどのシステムメトリクスと、データローディング・前処理・バックワードパスなどのフレームワークレベルのメトリクスを自動収集します。ボトルネック(データローディング待ち・GPUアイドル等)を可視化するProfiler Reportも自動生成されるため、根本原因の特定に最適です。
C
SageMaker Processing Jobでデータ前処理を行い、トレーニング前にデータをS3に保存しておく
Processing Jobでのデータ前処理はボトルネックの診断ではなく対処であり、詳細な診断情報を得ることはできません。
D
ml.p4d.24xlargeなどGPUメモリが大きいインスタンスタイプに変更してトレーニングを再実行する
インスタンス変更はボトルネックの原因究明にはならず対症療法にすぎません。

解説

正解: SageMaker Debuggerのプロファイラー機能を有効化し、システムメトリクスとフレームワークメトリクスを収集・分析する。 SageMaker Debuggerのプロファイラーは、CPU・GPU・ネットワーク・I/Oなどのシステムメトリクスと、データローディング・前処理・バックワードパスなどのフレームワークレベルのメトリクスを自動収集します。ボトルネック(データローディング待ち・GPUアイドル等)を可視化するProfiler Reportも自動生成されるため、根本原因の特定に最適です。 選択肢Aは、CloudWatchカスタムメトリクスはGPU使用率の記録は可能ですが、フレームワークレベルのデータローディングボトルネックなど詳細な診断情報は得られません。 選択肢Cは、Processing Jobでのデータ前処理はボトルネックの診断ではなく対処であり、詳細な診断情報を得ることはできません。 選択肢Dは、インスタンス変更はボトルネックの原因究明にはならず対症療法にすぎません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る