AIP実装と統合

製薬会社が500GBの未公開研究論文(ラベルなし)と8,000件の研究者向けQ&Aペアを保有しています。ベースモデルは専門的な化学用語の理解精度が低い状況です。Amazon Bedrockを使ってQ&Aアシスタントを構築する際、最も効果的なカスタマイズ戦略はどれですか?

A
Bedrock Knowledge Basesで500GBの論文をインデックス化し、プロンプトエンジニアリングでQ&Aを実装する
Bedrock Knowledge Basesでインデックス化は、RAGのみで専門用語理解の根本改善にならない。
B
8,000件のQ&Aペアのみを使って指示ファインチューニング(IFT: Instruction Fine-Tuning)を実施する
8,000件のQ&Aペアのみは、IFTのみでは専門知識の不足が残る。
C
まず500GBコーパスで継続事前学習(CPT: Continued Pre-Training)を実施し、そのCPT適応済みモデルに対して8,000件のQ&Aペアで指示ファインチューニング(IFT)を適用する
✓ 正解
CPT(継続事前学習)は大量のラベルなしドメインテキストでモデルにドメイン固有知識を注入し、IFT(指示ファインチューニング)はその知識を持つモデルに指示追従能力を与える2段階アプローチが最も効果的です。
D
8,000件のQ&Aペアをプレーンテキストに変換して継続事前学習(CPT)を実施する
8,000件のQ&Aペアでの継続事前学習は、CPTの入力形式が誤り(CPTはラベルなし連続テキストを使用する)。

解説

CPT(継続事前学習)は大量のラベルなしドメインテキストでモデルにドメイン固有知識を注入し、IFT(指示ファインチューニング)はその知識を持つモデルに指示追従能力を与える2段階アプローチが最も効果的です。 選択肢AのBedrock Knowledge Basesでインデックス化は、RAGのみで専門用語理解の根本改善にならない。 選択肢Bの8,000件のQ&Aペアのみは、IFTのみでは専門知識の不足が残る。 選択肢Dの8,000件のQ&Aペアでの継続事前学習は、CPTの入力形式が誤り(CPTはラベルなし連続テキストを使用する)。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIP の問題一覧に戻る