AIP基盤モデルの統合、データ管理、コンプライアンス
製薬会社が Amazon Bedrock Knowledge Bases を使用して、20〜80 ページの研究論文から薬物相互作用情報を抽出・回答する RAG システムを構築しています。重要情報は序論・方法・結果・考察の各セクションに散在しています。「関連セクションの広いコンテキストを保持しつつ、精密な情報を高精度で検索できる」チャンキング戦略として最適なものはどれですか?
A固定サイズチャンキング(512 トークン・20% オーバーラップ)。一貫したサイズにより埋め込み品質が安定するため
固定サイズチャンキングは情報を恣意的に分断します。
B階層チャンキング(Hierarchical Chunking)。親チャンクでセクション全体のコンテキストを保持し、子チャンクで精密な情報を検索する
✓ 正解
Bedrock Knowledge Bases の階層チャンキングは、小さな子チャンクで精密検索を行い、取得時に親チャンク(より広い文脈)をモデルへ同時提供します。研究論文のように情報が複数セクションに散在する場合、子チャンクで薬物相互作用の記述を特定しつつ親チャンクで実験条件・文脈を保持できます。
Cセマンティックチャンキング。文章の意味的まとまりで分割するため、薬物相互作用の記述が分断されにくい
セマンティックチャンキングは意味的まとまりで分割するため薬物相互作用の記述の分断は減りますが、精密検索と広いコンテキストを同時に提供する仕組みがなく、複数セクションに散在する情報の横断的な文脈保持において階層チャンキングに劣ります。
Dドキュメント全体を単一ベクトルとしてインデックス化。論文全体のコンテキストを完全に保持できるため
ドキュメント全体をインデックス化することはコンテキスト長制限と検索精度の問題があります。
解説
Bedrock Knowledge Bases の階層チャンキングは、小さな子チャンクで精密検索を行い、取得時に親チャンク(より広い文脈)をモデルへ同時提供します。研究論文のように情報が複数セクションに散在する場合、子チャンクで薬物相互作用の記述を特定しつつ親チャンクで実験条件・文脈を保持できます。
選択肢A:固定サイズチャンキングは情報を恣意的に分断します。
選択肢C:セマンティックチャンキングは意味的まとまりで分割するため薬物相互作用の記述の分断は減りますが、精密検索と広いコンテキストを同時に提供する仕組みがなく、複数セクションに散在する情報の横断的な文脈保持において階層チャンキングに劣ります。
選択肢D:ドキュメント全体をインデックス化することはコンテキスト長制限と検索精度の問題があります。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →