MLAMLモデルの開発

医療系スタートアップが放射線科レポート(英語)を対象とした10クラス文書分類モデルを開発している。利用可能なラベル済みデータは2,500件で、モデルの精度と開発スピードを重視する。インフラ管理の負担を最小化しつつ、専門ドメインの事前学習済み言語表現を活用して性能を高めたい。

A
Amazon Comprehend のカスタム分類機能でラベル済みデータをアップロードし、AutoML でモデルをトレーニングする
Amazon Comprehend カスタム分類は手軽だが、医療ドメイン特化の事前学習モデルを明示的に選択・活用する手段が提供されていない。
B
SageMaker JumpStart から医療・科学ドメインの事前学習済み NLP モデルを選択し、2,500件でファインチューニングする
✓ 正解
JumpStart は BioBERT 等の医療・科学ドメイン特化モデルを提供し、少量データでのファインチューニングでドメイン固有の言語表現を最大限活用できる。
C
PyTorch で Transformer モデルをゼロからスクラッチトレーニングし、SageMaker Training Job で2,500件を使って学習させる
SageMaker Training Job でのスクラッチトレーニングはデータ数 2,500 件では学習不足になりやすく、事前学習表現の恩恵を受けられない。
D
Amazon Textract でレポートからテキストを抽出した後、SageMaker の BlazingText を使って単語埋め込みモデルで分類する
BlazingText は Word2Vec ベースの浅い単語埋め込みモデルであり、文脈考慮型の深層表現や医療ドメイン特化の事前学習は活用できない。

解説

JumpStart はドメイン特化の事前学習済みモデルを提供し、少量データでのファインチューニングで高精度を実現しつつインフラ管理も不要。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
MLA の問題一覧に戻る