MLAMLモデルの開発

機械学習エンジニアが過去 3 年分の日次売上データを用いて需要予測モデルを開発しています。本番環境では常に「過去データで学習・未来データを予測」という使われ方をします。モデルの汎化性能を正確に評価するとともに、データリーケージ(Data Leakage:未来情報が学習データに混入する問題)を防ぐために最も適切な交差検証戦略はどれか。

A
k-fold 交差検証(k=5):データをランダムに 5 分割し、各折でモデルを評価する
k-fold交差検証(k=5)はランダム分割であり時系列の順序を考慮しません。
B
層化 k-fold 交差検証(Stratified k-fold):各折でターゲット変数の分布比率を均一に保ちながら分割する
層化k-fold交差検証はクラス不均衡のある分類問題向けであり時系列の順序は考慮しません。
C
ウォークフォワード検証(Walk-forward Validation):時間的順序を保ち、常に過去データで学習・直後の未来データで評価するウィンドウを順次スライドさせる
✓ 正解
時系列データでk-foldなどのランダム分割を使うと、未来のデータが学習セットに混入するデータリーケージが発生し、評価指標が実態より楽観的になります。ウォークフォワード検証は「過去で学習→未来で評価」という本番の使われ方を忠実に再現してデータリーケージを防ぎます。
D
リーブワンアウト交差検証(Leave-One-Out CV):1 サンプルを検証用に残し、残り全データで学習することを繰り返す
リーブワンアウトCV(Leave-One-Out CV)も時間順序を無視するため時系列データには不適切で、計算コストも非常に高くなります。

解説

時系列データでk-foldなどのランダム分割を使うと、未来のデータが学習セットに混入するデータリーケージが発生し、評価指標が実態より楽観的になります。ウォークフォワード検証は「過去で学習→未来で評価」という本番の使われ方を忠実に再現してデータリーケージを防ぎます。 選択肢Aのk-fold交差検証(k=5)はランダム分割であり時系列の順序を考慮しません。 選択肢Bの層化k-fold交差検証はクラス不均衡のある分類問題向けであり時系列の順序は考慮しません。 選択肢DのリーブワンアウトCV(Leave-One-Out CV)も時間順序を無視するため時系列データには不適切で、計算コストも非常に高くなります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る