無限ノック › MLA 練習問題一覧 › 問題
MLA機械学習のためのデータ準備

あるコンピュータビジョンチームが、画像分類モデルのトレーニング用に Amazon S3 に保存された 100 万枚の製品画像にラベルを付ける必要があります。社内の専門アノテーター(ラベル付け担当者)は限られており、全件を人手でラベリングするとコストが予算の 10 倍になると試算されています。ラベルの品質を維持しながら人手によるアノテーションコストを最小化するためのアプローチとして最も適切なものはどれですか?

A
Amazon SageMaker Ground Truth のオートメーションラベリング機能を使用する。少量の人手ラベルでトレーニングした内部モデルが高信頼度(設定閾値以上)で自動ラベリングし、不確かな画像のみ人手にルーティングするアクティブラーニング(能動学習)ワークフローを構成する。
✓ 正解
Amazon SageMaker Ground Truth のオートメーション機能(アクティブラーニング)は、まず少量のデータを人手でラベリングして内部分類モデルを構築し、残りの画像に対して信頼度スコアが閾値を超えるものは自動ラベリング(コスト削減)、信頼度が低いものだけ人手にルーティングします。AWS の公式資料では最大約 70% のラベリングコスト削減事例が示されており、本シナリオの予算超過問題に直接対応します。
B
Amazon Rekognition の DetectLabels API を全画像に実行し、返された汎用ラベルをそのままトレーニングデータとして使用する。
Amazon Rekognition DetectLabels は汎用的な物体検出 API であり、企業固有の製品カテゴリには対応できず、品質管理も行われないため不適切です。
C
AWS Lambda を Amazon Mechanical Turk(クラウドソーシングによる外部作業委託サービス)に直接連携させ、全 100 万枚を外部ワーカーに配布してラベリングするカスタムワークフローをゼロから構築する。
Mechanical Turk 直接連携によるカスタム構築は、品質管理ロジック・ワーカー管理・集約処理を自前で実装する必要があり、Ground Truth の方がマネージドかつコスト効率が高いです。
D
SageMaker Processing ジョブ内で事前学習済みの ImageNet モデルを使って全画像にソフトラベルを生成し、信頼度スコアに関係なくトレーニングに使用する。
SageMaker Processing による擬似ラベル生成は、タスク固有のファインチューニングなしでは精度が低く、品質検証なしに使用するとモデル性能を大幅に低下させます。

解説

Amazon SageMaker Ground Truth のオートメーション機能(アクティブラーニング)は、まず少量のデータを人手でラベリングして内部分類モデルを構築し、残りの画像に対して信頼度スコアが閾値を超えるものは自動ラベリング(コスト削減)、信頼度が低いものだけ人手にルーティングします。AWS の公式資料では最大約 70% のラベリングコスト削減事例が示されており、本シナリオの予算超過問題に直接対応します。 選択肢BのAmazon Rekognition DetectLabels は汎用的な物体検出 API であり、企業固有の製品カテゴリには対応できず、品質管理も行われないため不適切です。 選択肢CのMechanical Turk 直接連携によるカスタム構築は、品質管理ロジック・ワーカー管理・集約処理を自前で実装する必要があり、Ground Truth の方がマネージドかつコスト効率が高いです。 選択肢DのSageMaker Processing による擬似ラベル生成は、タスク固有のファインチューニングなしでは精度が低く、品質検証なしに使用するとモデル性能を大幅に低下させます。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← MLA の問題一覧に戻る