MLA機械学習のためのデータ準備

あるデータサイエンティストはカテゴリ変数を含むデータセットを使用して線形モデルを学習させます。カテゴリ値に順序関係はありません。この特徴量を適切に変換する方法として最も適切なものはどれですか。

A
One-Hotエンコーディングを使用する
✓ 正解
順序のないカテゴリを独立した特徴量として表現できるため、不要な大小関係をモデルへ与えずに学習できる。
B
カテゴリ値をランダムな整数へ変換する
整数値の差に意味があるとモデルが解釈する可能性があり、実際には存在しない関係を学習する恐れがある。
C
カテゴリ列を削除して学習する
カテゴリ情報が予測に有用な場合、その情報を完全に失うためモデル性能低下につながる可能性がある。
D
すべてのカテゴリを同じ値へ変換する
全カテゴリが同一値になるため識別能力が失われ、特徴量としての価値がほぼなくなる。

解説

順序関係のないカテゴリ変数(名義変数)を数値へ直接変換すると、存在しない大小関係をモデルが誤って学習する可能性があります。One-Hotエンコーディングは各カテゴリを独立した0/1の特徴量として表現するため、線形モデルにおける名義変数の扱いとして最も推奨される手法です。 One-Hotエンコーディングを使用する:各カテゴリを独立したバイナリ特徴量として表現します。順序関係のないカテゴリデータを線形モデルで扱う際の標準的な手法であり、誤った順序関係の学習を防げます。 カテゴリ値をランダムな整数へ変換する:ランダムな整数を割り当てると、実際には存在しないカテゴリ間の大小関係をモデルが学習してしまいます。順序関係のないカテゴリには不適切な変換手法です。 カテゴリ列を削除して学習する:カテゴリ変数が持つ有用な情報をすべて破棄します。予測性能に寄与する可能性のある特徴量を削除すると精度低下につながります。 すべてのカテゴリを同じ値へ変換する:全カテゴリに同一値を割り当てると、カテゴリ間の識別情報が完全に消失します。モデルはカテゴリの違いをまったく学習できなくなります。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る