AIP基盤モデルの統合、データ管理、コンプライアンス
ある法律テック企業がAmazon Bedrock Knowledge Basesを使用した契約書レビューシステムを構築しています。対象は平均50ページのPDF契約書で、章・節・条項の階層構造を持ちます。ユーザーは「第3条第2項の違約金規定を教えて」のように特定条項を指定して質問し、文脈が完結した正確な回答が求められます。デフォルトの固定サイズチャンキング(300トークン)では条項の途中で分割が発生して文脈が欠落し、回答品質が低下しました。追加インフラの管理を最小化しながら検索精度と回答の文脈的完全性を両立するチャンキング戦略はどれですか?
A固定サイズチャンキングのトークン数を1,000に拡大し、20%のオーバーラップを設定して条項の途中分断を軽減する
固定サイズチャンキングのトークン拡大とオーバーラップは途中分断を減らすが、取得後の文脈補完メカニズムがなく回答の完全性を保証できない。
B階層型チャンキングを使用して小さい子チャンクで高精度な検索を行い、取得時に親チャンクで文脈を自動補完する
✓ 正解
階層型チャンキングは子チャンクの精度と親チャンクによる文脈補完をBedrockの組み込み機能として提供し、追加インフラ不要で両要件を満たす。
Cセマンティックチャンキングで意味的まとまりごとに分割し、条項の自然な談話境界に沿ったチャンクを生成する
セマンティックチャンキングは意味境界に沿った分割を改善するが、階層構造を持たず取得後の文脈自動補完には対応していない。
DLambdaカスタムチャンキングで条項番号をメタデータとして付与し、メタデータフィルタリングで検索精度を向上させる
Lambdaカスタムチャンキングはメタデータ検索精度を向上できるが、カスタムLambda実装が必要で追加インフラ管理最小化の要件に反する。
解説
Bedrock Knowledge Basesの階層型チャンキングは、子チャンクでベクター検索の精度を確保しつつ、取得時に対応する親チャンクを自動付与して文脈の完全性を実現する。追加Lambdaは不要。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →