無限ノック › AIF 練習問題一覧 › 問題
AIF生成AIの基礎

RAG(Retrieval-Augmented Generation:検索拡張生成)システムにおいて、ユーザーのクエリと社内ドキュメントの意味的な類似性を計算するために使用される技術はどれですか?また、その技術の説明として最も正確なものを選んでください。

A
TF-IDF(単語の出現頻度と逆文書頻度の積):文書中のキーワード出現頻度に基づいてドキュメントをランク付けし、クエリとの一致度を算出する
TF-IDFはキーワード出現頻度ベースのマッチングで意味理解が弱く類似表現を捉えられません。
B
Embedding(埋め込みベクトル):テキストの意味を高次元の数値ベクトルとして表現し、意味的に類似したテキストがベクトル空間上で近い距離になるよう変換する
✓ 正解
RAGではEmbeddingがセマンティック検索の核心技術です。Amazon Bedrock Titan Embeddings等のモデルがテキストを1536次元などの密なベクトルに変換し、意味的に近い文章がベクトル空間でも近くなるよう学習されています。事前にドキュメントをEmbeddingしてOpenSearch ServerlessなどのベクトルDBに格納し、クエリのEmbeddingとのコサイン類似度を計算し、ANN(Approximate Nearest Neighbor:近似最近傍探索)アルゴリズムで関連文書を高速検索します。
C
Named Entity Recognition(固有表現認識):テキストから人名・地名・組織名を抽出し、クエリとドキュメント間の共通エンティティで関連度を測る
NER(Named Entity Recognition)は人名・地名等の情報抽出技術であり意味的類似度の計算には使用しません。
D
One-hot Encoding(1ホットエンコーディング):単語を0と1のスパースベクトルで表現し、ベクトルの内積でドキュメント間の類似度を計算する
One-hotは語彙サイズ次元のスパースベクトルで語彙外の意味や文脈を捉えられず類似度計算に不向きです。

解説

RAGではEmbeddingがセマンティック検索の核心技術です。Amazon Bedrock Titan Embeddings等のモデルがテキストを1536次元などの密なベクトルに変換し、意味的に近い文章がベクトル空間でも近くなるよう学習されています。事前にドキュメントをEmbeddingしてOpenSearch ServerlessなどのベクトルDBに格納し、クエリのEmbeddingとのコサイン類似度を計算し、ANN(Approximate Nearest Neighbor:近似最近傍探索)アルゴリズムで関連文書を高速検索します。 選択肢AのTF-IDFはキーワード出現頻度ベースのマッチングで意味理解が弱く類似表現を捉えられません。 選択肢CのNER(Named Entity Recognition)は人名・地名等の情報抽出技術であり意味的類似度の計算には使用しません。 選択肢DのOne-hotは語彙サイズ次元のスパースベクトルで語彙外の意味や文脈を捉えられず類似度計算に不向きです。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る