AIP基盤モデルの統合、データ管理、コンプライアンス
ソフトウェア企業が Amazon Bedrock Knowledge Bases を使用して技術ドキュメントアシスタントを構築しています。ドキュメントは「製品ガイド全体 → チャプター(約 1,500 語)→ セクション(約 400 語)→ サブセクション(約 100 語)」という明確な階層構造を持ちます。ユーザーは「認証モジュールの概要は?」のような概念的な質問と「OAuth コールバック URL の正確なパラメータは?」のような精密な技術質問の両方を行います。単一のナレッジベースで両タイプの検索品質を最大化するチャンキング戦略として最も適切なものはどれですか?
Aセマンティックチャンキングを使用して言語的な意味境界でドキュメントを自動分割し、ドキュメント構造に依存しない完全な概念単位を捕捉する
セマンティックチャンキングは非構造化文書の意味境界検出に有効ですが、章・節・小節という明確な階層構造がある場合は、その構造を直接活用できる階層的チャンキングの方が両タイプの質問精度を最大化できます。
B階層的チャンキングを設定し、セクションレベルのチャイルドチャンクを精度検索の単位として使用し、ヒット時にチャプターレベルの親チャンクを文脈として返す
✓ 正解
階層的チャンキングは子チャンク(セクション)による高精度検索と、親チャンク(チャプター)による豊富な文脈提供を両立します。明確な階層構造を持つドキュメントで概念的・精密技術的両タイプの質問品質を最大化する最適な戦略です。
C512 トークンの固定サイズチャンキングに 20% オーバーラップを付与し、コンテキスト長と検索粒度の全般的なバランスをとる
固定サイズチャンキングはドキュメントの構造的・意味的境界を無視して一定トークン数で分割します。概念の断片化が発生しやすく、明確な階層構造があるドキュメントでは検索品質が階層的チャンキングに比べて劣ります。
D各チャプターを単一の大きなチャンクとして保存し、概念的・技術的両タイプの質問で完全なチャプターコンテキストを参照できるようにする
チャプター全体を単一チャンクにすると概念的質問の文脈は豊富になりますが、1,500 語のチャンクはベクトル検索の精度を低下させ、特定パラメータを問う精密技術質問で正確なセクションを特定できなくなります。
解説
Amazon Bedrock Knowledge Bases の階層的チャンキング(Hierarchical Chunking)では、親チャンク(大きなサイズ)と子チャンク(小さなサイズ)の 2 レベルを設定します。ベクトル検索は子チャンクを単位として行うため細粒度の精密検索が可能となり、ヒット後は対応する親チャンクをコンテキストとしてモデルに渡すことで十分な背景情報を提供します。明確な階層構造を持つドキュメントで概念的質問(親の広い文脈)と精密技術質問(子の高精度)の両方に効果的に対応できます。
選択肢Aのセマンティックチャンキングは文書の意味的境界を自動検出して分割しますが、明確な階層構造がある場合は構造情報を直接活用できる階層的チャンキングの方が検索品質を最大化できます。
選択肢Cの固定サイズチャンキングはドキュメントの意味境界を無視して分割するため概念の断片化が発生しやすく、構造化ドキュメントでは検索品質が劣ります。
選択肢Dのチャプター単位の大きなチャンクは概念的質問への文脈は豊富ですが、1 チャンクが大きすぎるためベクトル検索のノイズが増え精密技術質問での精度が低下します。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →