MLA機械学習のためのデータ準備
あるECサイト企業は100万枚の商品画像を50カテゴリに分類するための学習データセットを作成する必要があります。
現在、全画像にラベルが付いておらず、人手によるラベリングは1枚あたり約0.10 USDのコストがかかります。
ラベリング精度を一定水準に保ちながら総コストを最小化するために最も適切なアプローチはどれか。
ASageMaker Ground Truthのパブリックワークフォース(Amazon Mechanical Turk)を使用して全100万枚を並列ラベリングし、クオリティコントロール設定でアノテーターの一致率を確認する
Mechanical Turkによる全件人手ラベリングはラベル品質を一定に保てますが、100万枚すべてに人手コストがかかります。オートメーションラベリングによる最大70%のコスト削減効果を活用できず、コスト最小化の要件を満たしません。
BSageMaker Ground Truthのオートメーションラベリングを有効化し、学習が進むにつれ高信頼度サンプルを自動ラベル付けして人間によるレビュー対象を大幅に削減する
✓ 正解
SageMaker Ground Truthのオートメーションラベリングは、高信頼度予測を自動承認し人間レビューを低信頼度サンプルに絞ることで、ラベリングコストを最大70%削減しながら品質基準を維持できます。大規模ラベリングにおけるコスト最小化の最適解です。
CAmazon Rekognition Custom Labelsに画像をアップロードし、信頼度スコア0.90以上の予測結果のみを正式ラベルとしてトレーニングデータに採用する
Amazon Rekognition Custom Labelsはラベル付きデータから画像分類モデルをトレーニングするサービスであり、未ラベル画像へのアノテーション付与ツールではありません。信頼度閾値による自動採用は品質保証の仕組みが不十分です。
DSageMaker Autopilotに画像データとカテゴリ情報を入力して自動でラベリングとモデルトレーニングを実行し、最終的なラベル付きデータセットをエクスポートする
SageMaker Autopilotは構造化された表形式データに対する自動MLパイプライン構築ツールです。画像データのラベリングや画像分類タスクには対応しておらず、このシナリオに適用できません。
解説
SageMaker Ground Truthのオートメーションラベリング(自動ラベル付け)機能は、ラベリングジョブが進むにつれて学習する内部モデルを使用します。内部モデルが高い信頼度でラベルを予測できるサンプルは自動承認され、不確実なサンプルのみ人間ワーカーのレビューに回します。これにより、従来の全件人手ラベリングと比較して最大70%のコスト削減が見込めます。
自動ラベリングと人間レビューのハイブリッド構成で品質を担保しながらコストを最適化できる点が、このシナリオの要件に最も合致します。
選択肢AのMechanical Turkによる全件人手ラベリングは品質管理が可能ですが、100万枚 × 0.10 USD = 10万ドルの全額コストが発生し、自動化による削減効果がありません。
選択肢CのAmazon Rekognition Custom Labelsは画像分類推論サービスですが、未ラベル画像へのアノテーション付与ツールではなく、既存のラベル付きデータを使ったカスタムモデルのトレーニングに使用するものです。
選択肢DのSageMaker Autopilotは表形式データの自動MLに特化しており、画像データのラベリングや画像分類モデルの自動構築には対応していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →