MLA機械学習のためのデータ準備

製造業の品質管理チームが、製造ライン画像の不良品検知モデルをSageMakerでトレーニングしています。トレーニングデータは正常品99,800件・不良品200件(不良率0.2%)と極端に偏っており、初期モデルは精度98%を達成したものの不良品の再現率(Recall)は10%未満です。収集済みデータを最大限活用しながら再現率を大幅に改善するには、どのアプローチが最も適切ですか?

A
正常品をランダムサンプリングして200件に削減し、不良品200件と組み合わせた均衡データセットでトレーニングを再実行する
ランダムダウンサンプリングは収集済み正常品99,600件を廃棄することになり、データ最大活用の要件に反してモデルの汎化性能が低下する。
B
SageMaker Processing JobでSMOTEを実装し、合成不良品サンプルを生成して均衡化したデータでトレーニングする
✓ 正解
SMOTEはマイノリティクラスの近傍サンプルを補間して合成データを生成するため、全正常品データを保持しながら不良品の学習サンプルを増やして再現率を改善できる最適な手法。
C
SageMaker自動モデルチューニングでF1スコアを最適化指標に設定し、ハイパーパラメータ探索でモデルの再現率を改善する
SageMaker自動モデルチューニングはハイパーパラメータ最適化に有効だが、0.2%という極端なクラス不均衡に対してはデータレベルの対処なしに再現率を大幅改善することは難しい。
D
SageMaker ClarifyでClass Imbalance(CI)バイアス指標を算出してレポートを生成し、不均衡の定量結果をもとに追加データ収集のサンプリング計画を策定する
SageMaker Clarifyはクラス不均衡バイアスの定量化レポートを生成するが、追加データ収集の計画策定は即時の再現率改善策にならず既存データを活用した直接的な解決策ではない。

解説

SMOTEはマイノリティクラスの特徴空間を補間して合成サンプルを生成し、マジョリティクラスのデータを廃棄せずにトレーニングデータを均衡化できるため、収集済みデータを最大限活用しながら再現率を大幅改善できる。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る