あるコンピュータビジョンチームが、画像分類モデルのトレーニング用に Amazon S3 に保存された 100 万枚の製品画像にラベルを付ける必要があります。社内の専門アノテーター(ラベル付け担当者)は限られており、全件を人手でラベリングするとコストが予算の 10 倍になると試算されています。ラベルの品質を維持しながら人手によるアノテーションコストを最小化するためのアプローチとして最も適切なものはどれですか?
Amazon SageMaker Ground Truth のオートメーション機能(アクティブラーニング)は、まず少量のデータを人手でラベリングして内部分類モデルを構築し、残りの画像に対して信頼度スコアが閾値を超えるものは自動ラベリング(コスト削減)、信頼度が低いものだけ人手にルーティングします。AWS の公式資料では最大約 70% のラベリングコスト削減事例が示されており、本シナリオの予算超過問題に直接対応します。 選択肢BのAmazon Rekognition DetectLabels は汎用的な物体検出 API であり、企業固有の製品カテゴリには対応できず、品質管理も行われないため不適切です。 選択肢CのMechanical Turk 直接連携によるカスタム構築は、品質管理ロジック・ワーカー管理・集約処理を自前で実装する必要があり、Ground Truth の方がマネージドかつコスト効率が高いです。 選択肢DのSageMaker Processing による擬似ラベル生成は、タスク固有のファインチューニングなしでは精度が低く、品質検証なしに使用するとモデル性能を大幅に低下させます。