無限ノック › AIP 練習問題一覧 › 問題
AIP実装と統合

製造業の企業が Amazon Bedrock Knowledge Bases を使って機械マニュアルに基づく RAG ソリューションを構築しています。マニュアルは平均 500 ページで、技術仕様・トラブルシューティング・メンテナンス手順が章をまたいで相互参照されています。ユーザークエリ例:「第 4 章に記載の油圧ポンプ交換後のメンテナンス手順は?」のように、複数セクションにわたるコンテキストが必要なクエリが多くあります。検索失敗を最小化するための最適なチャンキング戦略はどれですか?

A
512 トークン固定・オーバーラップ 10% の固定サイズチャンキング
固定トークン境界での分割は実装が容易ですが、章をまたぐ技術マニュアルの関連情報が異なるチャンクに断絶されます。オーバーラップで一部緩和できるものの、複数セクションにわたるクロスリファレンスへの対応には根本的に不十分です。
B
トピックの類似性でテキストをグループ化するセマンティックチャンキング
トピック境界でチャンクを分割するため一般的なドキュメントの検索精度は向上しますが、技術マニュアルのような階層的な文書構造における親子関係を保持できません。章をまたぐ相互参照を必要とするクエリへの対応では階層型チャンキングに劣ります。
C
親子ドキュメント構造を保持する階層型チャンキング(Hierarchical Chunking)
✓ 正解
大きな親チャンクと小さな子チャンクの2層構造でドキュメントを管理します。子チャンクによる高精度なベクトル検索と、ヒットした子チャンクの親チャンクが持つ広いコンテキストを組み合わせることで、章をまたぐ相互参照クエリにも適切に対応できます。
D
ページ全体を単一ベクトルとして埋め込むチャンキングなし設定
ページ全体を単一ベクトルで表現するため、ベクトルがページ内の複数トピックを平均した表現になります。特定の技術手順を問う詳細なクエリでは類似チャンクを精度よく特定できず、検索失敗が多発して回答品質が低下します。

解説

Bedrock Knowledge Bases の階層型チャンキング(Hierarchical Chunking)は、大きな「親チャンク」と小さな「子チャンク」の 2 層構造でドキュメントを分割します。 検索時は精度の高い子チャンクでベクトル検索を行い、ヒットした子チャンクの親チャンクも合わせてコンテキストとして LLM に渡します。 これにより、章をまたぐ技術マニュアルの相互参照にも広いコンテキストを確保できます。 選択肢Aの固定サイズチャンキングは実装が簡単ですが、章をまたぐ関連情報が異なるチャンクに分断されるため、複数セクションにわたるコンテキストを必要とするクエリへの応答精度が低下します。 選択肢Bのセマンティックチャンキングはトピック境界でチャンクを分割するため一般的な文書には有効ですが、階層的文書構造を持つ技術マニュアルでは親子関係を保持できず、クロスセクション検索には劣ります。 選択肢Dのページ全体を単一ベクトルとする設定は、ベクトルが複数トピックの平均表現になってしまい、特定の技術手順を問う詳細なクエリに対する検索精度が著しく低下します。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る