AIP実装と統合
通信会社が Amazon Bedrock を使用して内部技術支援システムを構築しています。
同社は独自の技術略語・社内製品コード・ネットワーク設計パターンを記述した 800GB の技術ドキュメントを保有しており、モデルがこの専門知識を深く理解した上で技術者の質問に回答できるようにしたいと考えています。
ドキュメントはラベルなしのテキストデータです。RAG では対応できない暗黙的な専門知識の習得が目標であり、モデル自体への知識定着が優先されます。
この要件に最も適した Amazon Bedrock のモデルカスタマイズ手法はどれですか?
ABedrock のファインチューニングを使用して技術ドキュメントから入力・出力ペアを手動で作成し、教師あり学習でモデルをドメイン特化的にカスタマイズする
ファインチューニングは入力と期待される出力のペアデータが必要な教師あり学習手法です。ラベルなしの 800GB テキストドキュメントには対応しておらず、ペアデータの手動作成に膨大なコストがかかります。この要件のカスタマイズ手法としては不適切です。
BBedrock の継続事前学習(Continued Pre-training)を使用して、ラベルなしの技術ドキュメントをそのまま学習させ、モデルに専門ドメインの言語パターンと知識を定着させる
✓ 正解
継続事前学習はラベルなしのテキストコーパスをそのまま学習データとして使用し、モデルが特定ドメインの言語パターン・専門用語・暗黙的知識を習得します。800GB の大規模な非構造化技術ドキュメントを活用し、モデル自体に知識を定着させるという要件に完全に合致します。
CBedrock Knowledge Bases に技術ドキュメントをインデックス化し、RAG アーキテクチャで検索・リトリーバルしてモデルへの文脈情報として提供する
Bedrock Knowledge Bases を使用した RAG は外部ドキュメントを検索して文脈として提供する手法であり、モデル自体が知識を習得するわけではありません。暗黙的な専門知識の定着や検索対象外の知識の活用という要件は満たせません。
DSageMaker を使用して LoRA(Low-Rank Adaptation)でモデルをファインチューニングし、Bedrock カスタムモデルインポートで本番環境に組み込む
SageMaker LoRA はモデルの効率的なカスタマイズに有効ですが、教師あり学習手法であるためラベルなしデータには適しません。また Bedrock ネイティブ機能を使わず複雑なパイプライン構築が必要で、継続事前学習より実装・運用コストが高くなります。
解説
継続事前学習(Continued Pre-training)は、ラベルなしのテキストコーパスを使用してモデルの重みを更新し、特定ドメインの言語・知識・パターンをモデル自体に組み込む手法です。800GB の大規模な非構造化ドキュメントから専門用語・略語・暗黙的な知識を習得させるには最適であり、入力・出力ペアの作成が不要なためラベルなしデータをそのまま活用できます。
選択肢Aのファインチューニングは教師あり学習であり、高品質な入力・出力ペアが必要です。ラベルなしの 800GB ドキュメントからペアを手動作成するのは非現実的で、この要件には適しません。
選択肢CのKnowledge Bases による RAG は、ドキュメントの内容を検索・参照できますが、モデル自体が専門知識を習得するわけではなく、暗黙的な知識の定着という要件を満たしません。
選択肢Dの SageMaker LoRA は教師あり学習手法であるためラベルなしデータに適しておらず、Bedrock ネイティブの継続事前学習より複雑なパイプラインを必要とします。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →