MLAMLモデルの開発
あるニュースアプリの開発チームが、記事コメントを「肯定的・否定的・中立」に分類するNLPモデルを構築したいと考えています。手元のラベル付きコメントは約3,000件と少なく、ゼロから大規模言語モデルを訓練する計算リソースも時間もありません。事前学習済みのテキスト分類モデルを活用し、自社データで効率よく適応させたいと考えています。最も適切なアプローチはどれですか。
AAmazon SageMaker JumpStart の事前学習済みテキスト分類モデルを選び、自社のラベル付きデータで転移学習(ファインチューニング)する
✓ 正解
事前学習済みモデルが大規模コーパスで獲得した言語表現を再利用するため、ラベルが3,000件と少なくても少ない計算量で高精度な分類モデルを構築できる。転移学習により短時間・低コストで自社データへ適応でき要件に合致する。
BTransformer モデルを SageMaker Training Jobs でランダムな重み初期化からフルスクラッチで訓練する
ランダム初期化からのフルスクラッチ訓練は膨大なラベルデータと計算リソース・時間を要する。3,000件では汎化に必要なデータが不足し精度も上がりにくく、リソースを避けたいという要件に明確に反する。
CAmazon SageMaker Ground Truth で残りのコメントすべてに手動でラベルを付与してからルールベース分類器を作る
ルールベース分類器は文脈や言い回しの多様な自然言語に対する汎化能力が乏しく、肯定・否定・中立の微妙な判別が難しい。全件への手動ラベル付けも工数が大きく、効率的な適応という目的に合わない。
DAmazon SageMaker Feature Store にコメントを登録し、特徴量を共有してから線形回帰で分類する
線形回帰は連続値を予測する手法で、3クラスのテキスト分類には適さない。Feature Store は特徴量の保存・共有を担うサービスでモデル訓練自体は行わず、事前学習の活用という要件も満たさない。
解説
SageMaker JumpStart は、テキスト分類を含む多数の事前学習済みモデルをカタログから選び、自社のラベル付きデータで転移学習(ファインチューニング)できる機能です。
大規模コーパスで獲得済みの言語表現を再利用するため、ラベルが3,000件程度と少なくても高精度なモデルを少ない計算量で短時間に構築でき、フルスクラッチ訓練の時間とコストを回避できます。
選択肢Bのフルスクラッチ訓練は、膨大なデータと計算リソースを要し、3,000件では十分な精度が得られず要件にも反する。
選択肢Cのルールベース分類器は表現の多様な自然言語に対する汎化が弱く、手動ラベル付けも非効率である。
選択肢Dの線形回帰は連続値予測の手法で、多クラスのテキスト分類には適さず、Feature Store もモデル訓練自体は行わない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →