無限ノック › MLA 練習問題一覧 › 問題
MLAMLモデルの開発

あるMLチームが、単一の決定木を用いた住宅価格予測モデルを評価したところ、訓練データには非常によく適合する一方でテストデータでは精度が大きく低下し、データの小さな変動でも予測が大きくぶれる高バリアンス(過学習)の傾向が見られました。アルゴリズムのアプローチを見直して予測の安定性を高めたいと考えています。最も適切な手法はどれですか。

A
複数の決定木を異なるブートストラップ標本で訓練し予測を平均するバギング(ランダムフォレスト)を採用する
✓ 正解
復元抽出した複数の標本で決定木を個別に訓練し予測を平均することで、個々の木のばらつきを打ち消しバリアンスを低減する。高バリアンスな単一決定木の過学習を抑え、予測の安定性を高める正攻法のアンサンブル手法である。
B
決定木の深さをさらに増やし、訓練データへの適合度をより高めて精度を上げる
木の深さを増やすと訓練データへの適合がさらに強まり、過学習(高バリアンス)を一層悪化させる。テストデータでの汎化性能はむしろ低下するため、安定性を高めたい要件に逆行する。
C
訓練データの件数を減らし、モデルが学習するパターンを単純化する
訓練データを減らすとモデルが学べる情報が乏しくなり、データの偏りに対する感度が上がってバリアンスはさらに増大する。過学習の緩和にはデータを増やす方向が望ましく、削減は逆効果である。
D
推論エンドポイントのインスタンスタイプを GPU 搭載インスタンスに変更する
インスタンスタイプの変更は推論のスループットやレイテンシーに影響するインフラ設定であり、モデルの過学習やバリアンスとは無関係。予測の安定性という統計的課題は解決できない。

解説

バギング(Bootstrap Aggregating)は、元データから復元抽出した複数の標本でそれぞれモデルを訓練し、予測を平均(分類では多数決)するアンサンブル手法です。 個々の高バリアンスな決定木の予測のばらつきを平均化により打ち消すため、ランダムフォレストのようにバリアンスを下げて過学習を抑制し、予測の安定性を高められます。 選択肢Bの木をさらに深くする手法は、訓練データへの過適合をさらに強め過学習を悪化させる。 選択肢Cのデータ件数の削減は、学習に使える情報が減りバリアンスがさらに増大して逆効果となる。 選択肢Dのインスタンスタイプ変更は推論速度に関する話で、モデルの過学習やバリアンスとは無関係である。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る