製造業の品質管理チームが、製造ライン画像の不良品検知モデルをSageMakerでトレーニングしています。トレーニングデータは正常品99,800件・不良品200件(不良率0.2%)と極端に偏っており、初期モデルは精度98%を達成したものの不良品の再現率(Recall)は10%未満です。収集済みデータを最大限活用しながら再現率を大幅に改善するには、どのアプローチが最も適切ですか?
SMOTEはマイノリティクラスの特徴空間を補間して合成サンプルを生成し、マジョリティクラスのデータを廃棄せずにトレーニングデータを均衡化できるため、収集済みデータを最大限活用しながら再現率を大幅改善できる。