MLA機械学習のためのデータ準備
ある医療系スタートアップが、X線画像から異常を検出する画像分類モデルを構築しています。50,000枚のX線画像に「正常」「要精査」のラベルを付ける必要がありますが、医療専門知識が必要なため一般の作業者は使えません。社内には放射線科医が5名おり、なるべく彼らの作業負担を削減しながら高品質なラベルを大量生成したいと考えています。コスト効率よく高品質なラベルを生成するための最も適切なアプローチはどれですか?
AAmazon Mechanical Turk(パブリックワークフォース)で全50,000枚のラベリングを依頼し、作業完了後に社内の放射線科医が全件をダブルチェックして品質を担保する
パブリックワークフォースは医療専門知識を持たない一般作業者で構成されるため、X線画像の医療的判断には不適切。全件ダブルチェックを加えると専門家の工数がむしろ増大し、コスト効率が大幅に低下する。
BAmazon SageMaker Ground TruthのActive Learning機能とプライベートワークフォース(社内放射線科医)を組み合わせ、高信頼度の画像を自動ラベリングし、低信頼度のみ専門家がレビューする
✓ 正解
SageMaker Ground TruthのActive Learningはラベリングモデルを継続的に改善し、高信頼度サンプルを自動ラベリングするため、専門家の作業量を大幅に削減しながら品質を保てる。プライベートワークフォースで社内専門家のみに限定でき、医療情報の機密性も担保される。
CAmazon SageMaker Processing Jobでルールベースの画像処理スクリプトを実行し、ピクセル密度や輝度の閾値によって全画像を自動分類し、専門家レビューを不要とする
ルールベーススクリプトはピクセル閾値のような単純な基準しか使えず、医療専門知識が要求されるX線異常の微妙なパターンを正確に検出できないため、教師あり学習に必要なラベル品質を保証できない。
DAmazon Rekognition Custom Labelsを使用して少量のサンプル画像でモデルをトレーニングし、残り全ての画像を自動分類することで専門家の作業時間を完全に排除する
Rekognition Custom Labelsは推論(画像分類・物体検出)のためのサービスであり、Ground Truthが提供するような大量データへのラベリングワークフロー管理やActive Learningによる人手作業削減機能は提供していない。
解説
Amazon SageMaker Ground TruthのActive Learning(自動ラベリング)は、人手ラベル済みの初期データでラベリングモデルを訓練し、高信頼度サンプルを自動ラベリング・低信頼度サンプルのみ人間に送るハイブリッドアプローチを採用している。これにより人手ラベリングコストを最大70%削減できる。プライベートワークフォース機能により社内の医療専門家のみに限定したレビュー環境を構築でき、医療情報の機密性も担保される。
選択肢AのAmazon Mechanical Turk(パブリックワークフォース)は、一般作業者が医療画像を判定するため品質が低く、全件ダブルチェックは専門家の工数を最大化してコスト効率が悪い。
選択肢CのSageMaker Processing Jobは、ルールベーススクリプトでは医療専門知識が必要な微妙な異常を検出できず、専門家レビューを排除すると誤ラベルが多発する。
選択肢DのAmazon Rekognition Custom Labelsは、画像認識推論サービスであり、Ground Truthのようなラベリングワークフロー管理やActive Learning機能を持たない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →