MLA機械学習のためのデータ準備

ある企業はAmazon SageMaker Data Wranglerを使用して学習データを準備しています。データセットには欠損値を含む数値列が複数存在します。学習時の情報損失を抑えながら前処理を実施したい場合、最も適切な方法はどれですか。

A
列全体に欠損値がある行を削除する
欠損率が低い場合には利用できるものの、有効なサンプルまで失われるため学習データ量が減少し、モデル性能低下の原因になる可能性がある。
B
欠損値を列の中央値で補完する
✓ 正解
外れ値の影響を受けにくく、数値データの代表値として利用しやすい。元の分布を比較的維持しながら欠損値を補完できる。
C
欠損値を常に0で置換する
0が本来の値として意味を持つ場合に分布を歪める恐れがあり、モデルへ誤ったパターンを学習させる可能性がある。
D
欠損値を含む列を削除する
特徴量自体の情報を失うため、予測に有用なシグナルまで除去してしまう可能性があり推奨されない。

解説

中央値による補完は、外れ値の影響を受けにくく、数値データの分布を大きく歪めずに欠損値へ対応できるため適切です。行削除は有効なデータを失う可能性があり、列削除は特徴量そのものを失います。0による一律置換は本来の分布を歪める可能性が高く、特に0が意味を持つデータでは誤った学習につながる恐れがあります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る