あるデータサイエンティストはカテゴリ変数を含むデータセットを使用して線形モデルを学習させます。カテゴリ値に順序関係はありません。この特徴量を適切に変換する方法として最も適切なものはどれですか。
順序関係のないカテゴリ変数(名義変数)を数値へ直接変換すると、存在しない大小関係をモデルが誤って学習する可能性があります。One-Hotエンコーディングは各カテゴリを独立した0/1の特徴量として表現するため、線形モデルにおける名義変数の扱いとして最も推奨される手法です。 One-Hotエンコーディングを使用する:各カテゴリを独立したバイナリ特徴量として表現します。順序関係のないカテゴリデータを線形モデルで扱う際の標準的な手法であり、誤った順序関係の学習を防げます。 カテゴリ値をランダムな整数へ変換する:ランダムな整数を割り当てると、実際には存在しないカテゴリ間の大小関係をモデルが学習してしまいます。順序関係のないカテゴリには不適切な変換手法です。 カテゴリ列を削除して学習する:カテゴリ変数が持つ有用な情報をすべて破棄します。予測性能に寄与する可能性のある特徴量を削除すると精度低下につながります。 すべてのカテゴリを同じ値へ変換する:全カテゴリに同一値を割り当てると、カテゴリ間の識別情報が完全に消失します。モデルはカテゴリの違いをまったく学習できなくなります。