RAGシステムを構築するエンジニアが、ユーザーの質問に最も関連性の高い社内ドキュメントを効率的に検索する仕組みを設計しています。RAGの検索コンポーネントとして正しい手順はどれですか?(2つ選択)
RAGの検索コンポーネントはセマンティック検索(意味的検索)が核心です。まずドキュメントを埋め込みモデルでベクトルに変換してベクトルデータベースに格納し(選択肢A)、次にユーザーのクエリも同様にベクトル化してコサイン類似度などで類似度検索を行います(選択肢C)。これによりキーワードが完全一致しなくても意味的に関連するドキュメントを取得できます。 選択肢BはBM25などキーワードベースの検索に限定され、意味的な関連性を捉えられないためRAGのセマンティック検索要件を満たしません。 選択肢DはLLMのコンテキストウィンドウのトークン上限により大量ドキュメントの一括処理が実用的でなく、コスト面でもスケール面でも現実的ではありません。