無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

MLチームが病院患者の30日以内再入院リスクを予測するバイナリ分類モデルをSageMaker Autopilotで自動構築しようとしています。トレーニングデータは30万件の患者記録で、トレーニング時間に制約はありません。複数の異なるアルゴリズムを試して最高精度のモデルを取得することを最優先としています。Autopilotジョブを設定する際、最も適切なトレーニングモード選択はどれですか?

A
モードをHPOに設定し、ベイズ最適化によって1つのアルゴリズムファミリーのハイパーパラメータ空間を集中的に探索する
HPOモードはベイズ最適化で単一アルゴリズムファミリーのハイパーパラメータを集中探索する。複数アルゴリズムのスタックアンサンブルを構築しないため、「複数アルゴリズムを組み合わせて最高精度を得る」という要件を満たさない。
B
モードをAutoに設定し、データセットのサイズと特性に基づいてSageMakerが最適なモードを自動的に選択する
Autoモードはデータセットの特性によりEnsemblingまたはHPOモードが自動選択されるが、30万件データでEnsemblingが選ばれる保証はなく、最高精度を確実に優先するという要件を明示的に制御できない点が不十分。
C
モードをEnsemblingに設定し、AutoGluon-Tabularで複数アルゴリズムのスタックアンサンブルを自動構築する
✓ 正解
EnsemblingモードはAutoGluon-Tabularで複数アルゴリズム(LightGBM・XGBoost・NN・CatBoostなど)を自動試行し、スタックアンサンブルを構築する。時間制約なし・精度最優先の要件に最も直接的に合致するAutopilotモードである。
D
Autopilotを使わず、SageMaker Training Jobsで複数のアルゴリズムを個別実装してアンサンブルを手動構築する
Training Jobsでの手動実装は開発者がアルゴリズム実装・ハイパーパラメータ探索・アンサンブル結合を全て手動でコーディングする必要がある。Autopilotの自動化メリットを放棄することになり、要件への適合方法として非効率である。

解説

SageMaker AutopilotのEnsemblingモードはAutoGluon-Tabularをバックエンドとして使用し、LightGBM・XGBoost・ニューラルネットワーク・CatBoostなど複数の異なるアルゴリズムを自動的に試行し、それらのスタックアンサンブルを構築します。時間制約がなく最高精度を優先する要件に最も合致するモードです。 選択肢AのHPOモードはベイズ最適化によって1つのアルゴリズムファミリーのハイパーパラメータ空間を最適化しますが、複数アルゴリズムのスタックアンサンブルは構築しないため、Ensemblingモードと比較して精度が劣る場合があります。 選択肢BのAutoモードはデータセットサイズに応じてAutopilotがモードを自動選択しますが、30万件のデータでEnsemblingが選ばれる保証はなく、精度最優先の要件を明示的に制御できません。 選択肢DのSageMaker Training Jobsでの手動実装はアンサンブル構築自体は可能ですが、Autopilotの自動化メリットを放棄することになり、開発工数が大幅に増加します。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る