MLA機械学習のためのデータ準備

ECサイトが、商品画像を8カテゴリに分類するモデルのトレーニングに向けて、S3に保存された50万枚の未ラベル画像のラベリングを行う必要があります。チームはすでに5,000枚を社内専門家がラベリングしており、残りの495,000枚についてラベリング品質を維持しながらコストを最小化する方法を検討しています。AWS上でコスト効率よく高品質なラベルを大量生成するには、どの構成が最も適していますか?

A
Amazon Mechanical Turkの一般ワーカーで全495,000枚をラベリングし、信頼度の低い画像を専門家レビューに送付する
Amazon Mechanical Turkは低コストな一般ワーカーを活用できるが、専門的な商品カテゴリ分類に必要なドメイン知識が不足する場合があり、品質保証のための追加レビューコストが生じる。
B
SageMaker Ground TruthのAuto Labelingを有効化し、MLモデルが高信頼度画像を自動ラベリングして低信頼度画像のみ人間ワーカーへ送付する
✓ 正解
SageMaker Ground TruthのAuto Labelingは既存ラベル済みデータでMLモデルを学習させ、高信頼度画像を自動ラベリングして人的作業量を大幅削減できる最もコスト効率の高い手法。
C
Amazon Rekognitionカスタムラベルで初期分類モデルをトレーニングし、信頼度が低い画像のみGround Truthラベリングタスクに転送する
Amazon Rekognitionカスタムラベルとの組み合わせは2サービスの管理コストが増し、Ground TruthのAuto Labeling単体より構成・運用が複雑になる。
D
SageMaker Ground Truthのプライベートワークフォースに社内専門家を登録し、全50万枚をラベリングキューに投入してバッチ処理と作業割り当ての自動化で効率を最大化する
SageMaker Ground Truthのプライベートワークフォースに全件を投入する構成は高品質なラベリングが可能だが、人件費が最大化しAuto Labelingによる自動化のコスト削減が活用できない。

解説

SageMaker Ground TruthのAuto Labelingはアクティブラーニングにより既存ラベル済みデータでMLモデルを構築し、高信頼度サンプルを自動ラベリングして人手が必要な量を大幅削減することでラベリングコストを最小化する。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る