無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備複数選択

データサイエンティストが不正検知の二値分類モデルを構築しています。学習データは正常取引99%・不正取引1%という高いクラス不均衡状態です。このデータをそのまま使うと正解率(Accuracy)は99%に達するものの、不正取引の再現率(Recall)は極めて低くなりました。SageMaker Processing を使ったデータ準備段階でこの問題に対処する方法として最も適切なものを2つ選んでください。

A
SMOTE(Synthetic Minority Over-sampling Technique:近傍サンプルを補間して少数クラスの合成サンプルを生成するオーバーサンプリング手法)を用いて少数クラスのサンプル数を増加させ、クラス比率を改善する
✓ 正解
SMOTE(Synthetic Minority Over-sampling Technique)は近傍サンプルを補間して少数クラスの合成サンプルを生成するオーバーサンプリング手法で、クラス不均衡対策の代表的手法です。
B
多数クラス(正常取引)をランダムにサンプリングしてデータ量を削減するアンダーサンプリングを行い、クラス比率を均衡化する
✓ 正解
多数クラスをランダムにサンプリングしてデータ量を削減するアンダーサンプリングもクラス不均衡対策の有効手法で、SMOTEと併用して実装できます。
C
正解率(Accuracy)を99%以上に維持できているため、データ準備は完了と判断してそのままモデルをデプロイする
クラス不均衡データではAccuracyの『精度のパラドックス』で高値を示すため、不正検知ではPrecision・Recall・F1・AUC-ROCが適切で、Accuracy だけで評価完了と判断できません。
D
不均衡はアルゴリズム側が自動解決するため、データ準備での対処は不要でハイパーパラメータのチューニングのみ実施する
クラス不均衡はアルゴリズムが自動解決しないため、データ準備段階でのSMOTE・アンダーサンプリング等の対処が重要です。

解説

正解: A. SMOTE(Synthetic Minority Over-sampling Technique:近傍サンプルを補間して少数クラスの合成サンプルを生成するオーバーサンプリング手法) B. 多数クラス(正常取引)をランダムにサンプリングしてデータ量を削減するアンダーサンプリングを行い、クラス比率を均衡化する。 クラス不均衡への対処としてSMOTEによるオーバーサンプリングと多数クラスのアンダーサンプリングは代表的な手法であり、SageMaker Processing内でimbalanced-learnライブラリを用いて実装できます。高不均衡データにおけるAccuracyは「精度のパラドックス」が発生し、常に多数クラスを予測しても高精度になるため評価指標として不適切です。不正検知ではPrecision・Recall・F1スコア・AUC-ROCが適切です。クラス不均衡はアルゴリズムが自動解決しないためデータ準備段階での対処が重要です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る