AIP基盤モデルの統合、データ管理、コンプライアンス
法律事務所が、契約書(PDF形式、平均200ページ)を対象としたRAGシステムをAmazon Bedrock Knowledge Basesで構築しています。契約書は「定義条項」「権利義務」「免責事項」「解除条件」などのセクションで構成されており、ユーザーは「第3条の義務違反時のペナルティは何か」のようなセクション参照を含む質問をします。最も検索精度が高いチャンキング戦略はどれですか?
A固定サイズチャンキング(1000トークン/チャンク、オーバーラップなし)でインデックス化し、ベクトル類似度で検索する
固定サイズチャンキングはセクション境界を無視してテキストを分割するため、「第3条の義務違反」のようなセクション単位の参照を含む質問において関連情報が複数チャンクに分断され、検索精度が低下します。
B固定サイズチャンキング(500トークン/チャンク、50トークンオーバーラップ)でインデックス化し、ベクトル検索のみで取得したチャンクをLLMに渡す
固定サイズチャンキングはセクション構造を考慮しないため意味が分断されやすく、また取得したチャンクのみをLLMに渡すためセクション全体のコンテキストが失われ、法律文書の階層的な質問には不適切です。
CHierarchical Chunkingでセクションを親チャンク・段落を子チャンクとし、子チャンクで検索しつつ親チャンク全体をLLMに提供する
✓ 正解
子チャンクの細粒度ベクトルで精密に関連箇所を特定しつつ、親チャンク(セクション全体)をLLMに提供することでコンテキストの連続性を保ちます。Amazon Bedrock Knowledge BasesがネイティブサポートするRAGに最適な手法です。
D文書全体(平均200ページ)を1チャンクとしてインデックス化し、クエリに関係なく全文を常にLLMのコンテキストとして提供する
200ページのPDFを1チャンクにするとトークン数が膨大になりLLMのコンテキスト長制限に抵触するリスクが高く、クエリに無関係な情報も常に送信されるため推論コストが大幅に増大します。
解説
階層型チャンキング(Small-to-Big Retrieval)は、細粒度の子チャンクで精密なベクトル検索を行いながら、親チャンク(セクション全体)をLLMに提供することでコンテキストの連続性を保ちます。法的文書のセクション参照質問に特に有効で、Amazon Bedrock Knowledge BasesはHierarchical Chunkingをネイティブサポートしています。
選択肢Aの固定サイズチャンキング(1000トークン、オーバーラップなし)はセクション境界を無視してテキストを分割するため、「第3条の義務違反」のようなセクション参照を含む質問への検索精度が低下します。
選択肢Bの固定サイズチャンキング(500トークン、50トークンオーバーラップ)もセクション構造を考慮しないため意味が分断されやすく、法律文書の階層的な参照を必要とする質問には不適切です。
選択肢Dの文書全体を1チャンクとする方法は、200ページのPDFでは大量のトークンが必要となりコンテキスト長制限に抵触し、推論コストの大幅な増大を招きます。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →