無限ノック › AIP 練習問題一覧 › 問題
AIP基盤モデルの統合、データ管理、コンプライアンス

グローバル製造業がAmazon Bedrock Knowledge Basesを使用して、15言語(英語・日本語・ドイツ語・アラビア語・スペイン語等)で記述された200万件の技術サポートドキュメントを対象とした多言語RAGシステムを構築しています。顧客はどの言語でクエリを投入しても、別の言語で記述されたドキュメントも含む全文書から正確な回答を得られることが必須要件です。翻訳レイヤーを追加せずにこの多言語クロスランゲージ検索要件を満たす最も適切な埋め込みモデル選択はどれですか?

A
Amazon Titan Text Embeddings V2を使用し、クエリとドキュメントをAmazon Translateで事前に英語へ翻訳してから埋め込み処理を行い、英語統一のベクターインデックスを構築する
Titan Text Embeddings V2は高品質な英語埋め込みを提供しますが、Amazon Translateによる翻訳が必要なため翻訳精度への依存・コスト増加・レイテンシ悪化が発生し、翻訳レイヤーなしという要件にも反します。
B
Cohere Embed Multilingualモデルをベクターストアに使用する。100以上の言語を単一の埋め込み空間に統合するため、言語を横断したセマンティック検索を翻訳なしでネイティブに実現できる
✓ 正解
Cohere Embed Multilingualは100以上の言語を単一の埋め込み空間にマッピングし、クロスランゲージのセマンティック類似度計算が可能です。Bedrock Knowledge Basesで選択でき、翻訳レイヤーなしで多言語検索要件を満たします。
C
言語グループごとに個別のAmazon Titan Embeddings V2 Knowledge Baseを作成し、クエリ言語をAmazon Comprehendで検出してから対応するKnowledge Baseへルーティングする
言語グループ別Knowledge Baseの分割では、日本語クエリでドイツ語ドキュメントを検索するようなクロスランゲージ検索が不可能であり、全言語ドキュメントから回答を得るという要件を構造的に満たせません。
D
Amazon Titan Multimodal Embeddingsを使用し、テキストと言語識別メタデータを組み合わせた埋め込みを生成することで多言語コンテンツの統合インデックスを構築する
Titan Multimodal Embeddingsはテキストと画像の複合埋め込みに特化したモデルであり、多言語テキストの統合セマンティック空間を構築するための設計ではなく多言語RAGの要件には適しません。

解説

Cohere Embed Multilingualは100以上の言語を単一の高次元ベクター空間にマッピングするよう設計されており、意味的に類似したテキストは言語が異なっていても近いベクター値を持ちます。これにより日本語クエリでドイツ語やアラビア語のドキュメントを直接検索するクロスランゲージ・セマンティック検索が翻訳なしで実現できます。Amazon Bedrock Knowledge BasesはCohere Embed Multilingualを埋め込みモデルとして選択でき、OpenSearch ServerlessなどのベクターストアにそのARNを指定するだけで多言語インデックスを構築できます。 選択肢AのAmazon Titan Text Embeddings V2は高品質な英語埋め込みを提供しますが、Amazon Translateを介した翻訳が必要となり翻訳精度への依存・コスト増加・レイテンシの悪化という問題が生じ、翻訳レイヤー不要という要件にも反します。 選択肢CのKnowledge Baseを言語グループ別に分割するアプローチは、言語をまたいだ検索(例:日本語クエリでドイツ語文書を取得)ができず、全言語文書から回答を得るという要件を構造的に満たせません。 選択肢DのAmazon Titan Multimodal Embeddingsはテキストと画像を組み合わせた埋め込みに特化したモデルであり、多言語テキストの統合埋め込み空間の構築を目的とした設計ではありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る