RAG(Retrieval-Augmented Generation:検索拡張生成)システムにおいて、ユーザーのクエリと社内ドキュメントの意味的な類似性を計算するために使用される技術はどれですか?また、その技術の説明として最も正確なものを選んでください。
RAGではEmbeddingがセマンティック検索の核心技術です。Amazon Bedrock Titan Embeddings等のモデルがテキストを1536次元などの密なベクトルに変換し、意味的に近い文章がベクトル空間でも近くなるよう学習されています。事前にドキュメントをEmbeddingしてOpenSearch ServerlessなどのベクトルDBに格納し、クエリのEmbeddingとのコサイン類似度を計算し、ANN(Approximate Nearest Neighbor:近似最近傍探索)アルゴリズムで関連文書を高速検索します。 選択肢AのTF-IDFはキーワード出現頻度ベースのマッチングで意味理解が弱く類似表現を捉えられません。 選択肢CのNER(Named Entity Recognition)は人名・地名等の情報抽出技術であり意味的類似度の計算には使用しません。 選択肢DのOne-hotは語彙サイズ次元のスパースベクトルで語彙外の意味や文脈を捉えられず類似度計算に不向きです。