AIP基盤モデルの統合、データ管理、コンプライアンス
法律事務所が契約書審査のRAGシステムをAmazon Bedrock Knowledge Basesで構築しています。法的文書には条文番号(例:第12条第3項)や判例番号(例:最判平成30年3月15日)などの正確な識別子が含まれており、これらはベクトル類似性だけでは正確に検索できません。一方で「損害賠償に関する免責条項の解釈」のような意味的な質問にも対応する必要があります。現在の意味的検索のみの実装では、識別子の完全一致検索精度が低い状態です。最適な解決策はどれですか?
Aチャンクサイズを512トークンから128トークンに削減し、より細粒度の意味的検索精度を向上させる
チャンク粒度を改善しますが完全一致問題を解決しません。
BAmazon Bedrock Knowledge BasesのバックエンドをAmazon OpenSearch Serverlessに設定し、ハイブリッド検索(意味的ベクトル検索+BM25キーワード検索)を有効化する
✓ 正解
ハイブリッド検索は意味的(ベクトル)検索とキーワードベース検索(BM25:文書中の単語頻度と逆文書頻度に基づく検索手法)を組み合わせます。BM25は完全一致や希少な専門用語・識別子の検索に優れており、条文番号・判例番号のような正確なテキストマッチを大幅に改善します。Amazon Bedrock Knowledge BasesはOpenSearch Serverlessバックエンドでこの機能をサポートしています。
C条文番号・判例番号をチャンクのメタデータフィールドに格納し、Amazon DynamoDBでの前処理フィルタリングパイプラインを追加する
複雑なカスタムパイプラインを要し汎用性が低いです。
D埋め込みモデルをAmazon Titan Text EmbeddingsからCohere Embed Multilingualに変更し、法律テキストの埋め込み表現品質を向上させる
意味的検索の改善に寄与しますがキーワード一致問題の根本解決になりません。
解説
ハイブリッド検索は意味的(ベクトル)検索とキーワードベース検索(BM25:文書中の単語頻度と逆文書頻度に基づく検索手法)を組み合わせます。BM25は完全一致や希少な専門用語・識別子の検索に優れており、条文番号・判例番号のような正確なテキストマッチを大幅に改善します。Amazon Bedrock Knowledge BasesはOpenSearch Serverlessバックエンドでこの機能をサポートしています。
選択肢Aはチャンク粒度を改善しますが完全一致問題を解決しません。
選択肢Cは複雑なカスタムパイプラインを要し汎用性が低いです。
選択肢Dは意味的検索の改善に寄与しますがキーワード一致問題の根本解決になりません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →