無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

MLエンジニアがSageMaker上でXGBoostモデルのハイパーパラメータ(モデルのトレーニング開始前に人が設定するパラメータ)を最適化しています。探索するパラメータ空間は広く、トレーニングジョブのコストを最小限に抑えながら最高性能を達成したいと考えています。最も効率的なアプローチはどれですか?

A
すべてのパラメータ組み合わせを網羅するグリッドサーチ(格子探索)を実行する
グリッドサーチはすべてのパラメータ組み合わせを探索するため試行回数が多く、高い計算コストがかかり、短納期には不向きです。
B
Amazon SageMaker Automatic Model TuningでBayesian(ベイズ)最適化戦略を選択し、最大並列ジョブ数を低く設定する
✓ 正解
Bayesian最適化は過去の試行結果を確率モデルで学習し、次の有望なパラメータ空間を予測するため少ない試行回数で優れた結果が得られます。並列ジョブ数を低く設定することで、各試行結果がフィードバックに活用でき、コスト効率が最大化されます。
C
Amazon SageMaker Automatic Model Tuningでランダム探索を選択し、最大並列ジョブ数を高くして高速に探索する
ランダム探索に最大並列ジョブ数を高くすると、各試行のフィードバックが活用されず、ランダム探索に近づいて効率が低下します。
D
SageMaker Experimentsで手動でパラメータを変更しながら複数のトレーニングジョブを実行して比較する
SageMaker Experimentsの手動実行は人的労力が高く、短納期で多くのパラメータ組み合わせを探索するには非効率です。

解説

Bayesian最適化は過去の試行結果を確率モデルで学習し次の有望なパラメータ空間を予測するため、グリッドサーチやランダム探索より少ない試行回数で優れた結果が得られます。並列ジョブ数を低く設定することで各試行の結果をフィードバックに活用でき(並列数が多すぎるとランダム探索に近づく)、コスト効率が最大化されます。 選択肢Aのグリッドサーチは全パラメータ組み合わせを網羅するため、パラメータ空間が広いほどジョブ数が指数的に増加しコストが膨大になります。 選択肢Cのランダム探索+高並列は過去の試行結果を活用できず、並列数を上げると各試行完了前に次の試行が始まるためBayesian最適化のフィードバックループが機能しません。 選択肢DのSageMaker Experimentsを使った手動比較は試行の体系化が難しく、広いパラメータ空間での探索には時間・コストともに非効率です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る