AIFAIとMLの基礎

あるデータサイエンスチームが住宅価格予測モデルを構築する過程で、生データから『築年数』を日付の差分として算出し、『地域』カテゴリを数値にエンコードし、面積を正規化する作業を行っています。ML開発ライフサイクルにおいて、この一連の作業に該当する工程はどれですか。

A
特徴エンジニアリング。生データを変換・加工し、モデルが学習しやすい入力変数を作成する
✓ 正解
生データを変換・加工してモデルが学習しやすい入力変数を作る工程が特徴エンジニアリング。日付差分による築年数算出、カテゴリのエンコード、面積の正規化はいずれも特徴量を整える典型的な作業に該当するため、これが正しい工程である。
B
データ収集。予測に必要な生データをさまざまなソースから集約して蓄積する
データ収集は予測に必要な生データを各種ソースから集めて蓄積する前段の工程。すでに集めたデータを変換・加工する作業を指すものではないため、本シナリオの一連の処理には当てはまらない。
C
モデルデプロイ。学習済みモデルを本番環境に配置し推論を提供できるようにする
モデルデプロイは学習済みモデルを本番環境へ配置し推論を提供できるようにする工程。データの変換・加工とは段階が異なり、入力変数を作成する作業の説明としては誤りである。
D
ハイパーパラメータチューニング。学習率やバッチサイズなどの設定値を調整し精度を高める
ハイパーパラメータチューニングは学習率やバッチサイズなど学習設定を調整する作業。入力変数そのものを生成・加工する特徴エンジニアリングとは別工程であり、本シナリオの作業には該当しない。

解説

特徴エンジニアリングは、生データをモデルが学習しやすい形の入力変数(特徴量)へ変換・加工する工程です。日付差分による築年数の算出、カテゴリ変数の数値エンコード、面積の正規化はいずれもこの工程に該当します。 選択肢のデータ収集は生データを集める前段の工程。 選択肢のモデルデプロイは学習済みモデルを本番配置する工程。 選択肢のハイパーパラメータチューニングは学習設定を調整する別工程です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る