無限ノック › AIP 練習問題一覧 › 問題
AIP基盤モデルの統合、データ管理、コンプライアンス

大手放送局が、テレビニュース番組(1 本あたり 30 分、1 日 50 本)の書き起こしテキストを対象とした RAG システムを Amazon Bedrock Knowledge Bases で構築しています。各番組は 2〜3 分ごとにトピックが切り替わる構成で、ユーザーのクエリは「先週火曜のインフレ報道」のようにトピック単位で具体的です。固定サイズチャンキング(1,000 トークン)を試験運用したところ、同一トピックの文脈が複数チャンクに分断され Recall が大幅に低下しました。精度を最大化するチャンキング戦略として最も適切なものはどれですか。

A
チャンクサイズを 256 トークンに縮小しオーバーラップを 50 トークンに設定することで、トピック境界に近い分割点を増やして文脈損失を軽減する
チャンクサイズを縮小しても分割点がトピック境界と一致する保証がなく、固定サイズ分割の根本問題(トピック文脈断絶)を解決できない。オーバーラップも断絶を部分的に緩和するのみで根本的な精度改善には不十分。
B
Bedrock Knowledge Bases のセマンティックチャンキングを使用し、文埋め込みのコサイン類似度に基づいてトピック境界を自動検出してチャンクを分割する
セマンティックチャンキングは意味境界でチャンクを自動分割できる点で有効だが、階層型チャンキングのような親チャンクによるコンテキスト保持機能を持たず、番組全体の文脈を LLM に提供する能力が劣る。
C
Bedrock Knowledge Bases の階層型チャンキングを使用し、番組全体を親チャンク、各 2〜3 分のトピックセグメントを子チャンクとして設定する
✓ 正解
階層型チャンキングで子チャンク(トピックセグメント)による精密な検索と、親チャンク(番組全体)によるコンテキスト提供を両立できる。2〜3 分のトピック境界と自然に整合し、固定サイズ分割のトピック断絶問題を構造的に解決する最適な選択。
D
書き起こしテキストを番組単位(30 分分)の単一チャンクとして保持し、LLM のロングコンテキスト能力にトピック識別を委ねる
30 分分の書き起こし全体を単一チャンクとするとベクター検索の粒度が粗くなり、クエリとの類似度計算でトピック単位の情報が埋もれて Recall が低下する。また LLM に渡すコンテキスト量が過大になりコスト増大を招く。

解説

Bedrock Knowledge Bases の階層型チャンキング(Hierarchical Chunking)は、子チャンクで精密な検索を行いながら対応する親チャンクをコンテキストとして LLM に渡す仕組みです。2〜3 分のトピックセグメントを子チャンクとし番組全体を親チャンクとすることで、トピックを分断せずに検索精度を保ちつつ番組全体の文脈も提供できます。固定サイズ分割で発生したトピック分断問題を構造的に解決できます。 選択肢Aの固定サイズチャンキング縮小はチャンクサイズを小さくしても分割点がトピック境界と一致するとは限らず、Recall 低下の根本原因を解消できません。 選択肢Bのセマンティックチャンキングはテキストの意味的まとまりでチャンクを自動分割できますが、親子関係のコンテキスト保持機能がなく、トピック周辺の番組全体の文脈を LLM に渡す能力が劣ります。 選択肢Dの番組単位大チャンクは 30 分分の書き起こし全体を 1 チャンクとするため、ベクター検索の粒度が粗くなり適切なチャンクを特定できず Recall が低下します。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る