無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備複数選択

あるMLチームが大手リテールチェーン向けに3年分の日次販売データを使用した需要予測モデルを開発しています。モデルの汎化性能を適切に評価するためのデータ分割戦略として、最も適切なものを2つ選んでください。

A
全期間のデータをランダムに80/20でトレーニング/テスト分割する
時系列データをランダムに分割すると、未来のデータがトレーニングに混入するデータリーケージが発生します。その結果、実際の予測性能よりも楽観的な評価になり、本番運用時の問題に気づけません。
B
直近20%の期間をテストセットとし、それ以前のデータをトレーニングに使用する時系列順の分割を行う
✓ 正解
直近20%の期間をテストセット、それ以前のすべてのデータをトレーニングとする時系列順分割です。実運用環境を模倣し、データリーケージを防ぎながら現実的な予測精度を評価できます。
C
商品カテゴリで層化したk-fold交差検証(k-分割交差検証:データをk個のグループに分割し、k-1個で学習・1個でテストをk回繰り返す評価手法)を使用する
商品カテゴリで層化しても、k-fold自体がランダムなデータシャッフルを伴うため、時系列データの時間的依存関係を無視してしまいます。時系列データ向けの評価方法ではありません。
D
ローリングウィンドウ評価(ウォークフォワード検証:過去データで学習し直近期間を予測するステップを時系列順に繰り返す評価手法)を使用し、モデルを段階的に再学習させながら評価する
✓ 正解
過去データで学習し直近期間を予測するステップを時系列順に複数回繰り返します。複数時点での予測精度を検証し、モデルの経時的な安定性も確認できるため、時系列データに最適な評価手法です。

解説

時系列データはデータポイント間に時間的依存関係があるため、ランダム分割や通常のk-fold交差検証を使用すると未来のデータがトレーニングに混入するデータリーケージ(情報漏洩)が発生し、過楽観的な評価になります。 選択肢Aの全期間ランダム分割は、未来データが学習データに混入するデータリーケージが発生し、時系列予測モデルの評価として不適切です。 選択肢Bの時系列順の分割は、最も基本的な時系列評価手法で実運用環境を模倣でき、データリーケージを防止できます。 選択肢Cの商品カテゴリで層化したk-fold交差検証は、時間的依存関係を無視した分割になるため時系列データには不適切です。 選択肢Dのローリングウィンドウ評価は、複数時点での予測精度を検証しモデルの経時的な安定性も確認できる時系列評価として適切です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る