AIF生成AIの基礎
ある製薬企業が、Amazon Bedrock の基盤モデルを自社の医療ドメインに最適化したいと考えています。手元には数十万件の医学論文・治験報告書(ラベルなしの生テキスト)があり、専門用語や文体をモデルに深く内在化させたい一方、質問と回答の対になった教師データは用意できていません。この要件に最も適した Bedrock のモデルカスタマイズ手法はどれですか。
A継続的事前学習(Continued Pre-Training)でラベルなしのドメインテキストを追加学習する
✓ 正解
継続的事前学習はラベルなしのドメインテキストでモデルの重みを追加学習し、専門用語や文体をモデルに内在化させます。教師データを必要とせず生テキストのみで実施できるため、今回の要件に最も適合します。
Bラベル付きの入力・出力ペアでモデルを調整するファインチューニング(Fine-tuning)
ファインチューニングは入力と出力のラベル付きペアを教師データとして必要とします。質問と回答の対が用意できない本ケースでは前提条件を満たせず実施できないため、要件に合致しません。
CKnowledge Bases を用いて外部文書を検索し回答に付与する RAG 構成
RAGはモデルの重みを変更せず、外部文書を検索して回答に付与する構成です。用語や文体をモデル自体へ深く内在化させる目的とは異なり、知識の取得方法が違うため要件に合いません。
Dプロンプトに数例を含めて推論時に挙動を誘導するフューショットプロンプティング
フューショットは推論時にプロンプトへ数例を含めて挙動を誘導するだけで、モデルの重みは変化しません。大量の生テキストでドメインを内在化させる学習にはならないため、要件を満たしません。
解説
継続的事前学習は、ラベルのない大量のドメイン固有テキストを用いてモデルの重みを追加学習させ、専門用語・文体・知識をモデル自体に内在化させる手法です。教師データ(入力・出力ペア)を必要としないため、生テキストしか持たない今回の要件に合致します。
選択肢Bのファインチューニングは入力・出力のラベル付きペアを前提とするため、教師データが用意できない本ケースでは実施できない。
選択肢Cの RAG はモデルの重みを変えず外部知識を検索して付与する手法で、用語や文体をモデルに内在化させる目的には合わない。
選択肢Dのフューショットは推論時にプロンプトで誘導するだけで、モデル自体の最適化ではない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →