AIP基盤モデルの統合、データ管理、コンプライアンス
法律事務所がAmazon Bedrock Knowledge Basesで契約書検索システムを構築しています。契約書は平均120ページで「第3条(損害賠償)第1項(賠償上限)」のような条・節・項の階層構造を持ちます。ユーザーは特定の節への詳細な質問と「この契約全体のリスク概要は」のような文書横断的な質問の両方を行います。RAGの検索精度を最大化するチャンキング戦略として最も適切なものはどれですか。
A固定512トークンの均一分割とオーバーラップ50トークンを設定し、一貫したチャンクサイズで全契約書を処理して実装を単純化する
固定チャンキングは文書の論理構造を無視して条項を途中で分割するため、特定節への詳細質問と文書横断的な質問の両方で検索精度が低下する。
Bセマンティックチャンキングを有効化し、文の意味的類似度に基づいて条項の境界を自動検出してチャンク境界を動的に最適化する
セマンティックチャンキングは意味的境界の自動検出に優れるが、単一粒度のチャンクでは詳細質問と文書横断的質問を同時に高精度で処理できない。
C階層チャンキングを使用し、親チャンクで条・節レベルの文脈を保持しつつ子チャンクで項レベルの精密な検索を可能にする
✓ 正解
階層チャンキングは親チャンク(条・節)と子チャンク(項)の両粒度を保持し、詳細質問には子、文書横断的質問には親を使い分けて精度を最大化できる。
DカスタムLambdaでRegexにより条・節・項を構造抽出し、階層ごとに独立したドキュメントとしてベクターストアへ格納するパイプラインを構築する
カスタムLambdaによる構造抽出は柔軟だが、Bedrock Knowledge Basesの組み込み階層チャンキングで同等の効果が得られるためオーバーエンジニアリングとなる。
解説
階層チャンキングは親チャンク(条・節レベルの文脈)と子チャンク(項レベルの詳細)を同時に保持し、詳細質問と文書横断的質問の両方の検索精度を最大化できます。
固定512トークンの均一分割は文書の論理構造を無視して条項を途中で分割するため、特定節への詳細質問と文書横断的な質問の両方で検索精度が低下します。
セマンティックチャンキングは意味的境界の自動検出に優れますが、単一粒度のチャンクでは詳細質問と文書横断的質問を同時に高精度で処理できません。
カスタムLambdaによる構造抽出は柔軟ですが、Bedrock Knowledge Basesの組み込み階層チャンキングで同等の効果が得られるためオーバーエンジニアリングとなります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →