無限ノック › AIP 練習問題一覧 › 問題
AIP基盤モデルの統合、データ管理、コンプライアンス

製薬会社が Amazon Bedrock を使用して医薬品添付文書から副作用情報を抽出・回答する RAG システムを本番稼働させています。品質評価には以下の要件があります: ・回答がソースドキュメントの記述に正確に基づいているか(忠実性)を評価したい ・医学用語の適切な使用を評価したい ・週次で 1,000 件以上の評価を自動化したい ・ゴールデンアンサーセット(正解集)が存在しない この状況で最も適切な評価アプローチはどれですか?

A
ROUGE-L スコアを使用して生成された回答と元のソース文書を比較する
ROUGE(Recall-Oriented Understudy for Gisting Evaluation)は n-gram 一致率を測定する指標で、要約品質評価に使われますが、「ソースに基づいているか」という RAG の忠実性評価には不適切です。
B
Exact Match および F1 スコアで生成回答の品質を自動評価する
Exact Match や F1 スコアはゴールデンアンサーとの厳密な比較が前提であり、正解集が存在しない本ケースでは使用できません。
C
Amazon Bedrock Model Evaluation の LLM ジャッジ機能で Claude などの高性能モデルを評価者として忠実性・関連性を採点させる
✓ 正解
Amazon Bedrock Model Evaluation は、別の大規模言語モデル(LLM)を「ジャッジ」として使用し、忠実性(Faithfulness:回答がコンテキストに基づいているか)・回答関連性・コンテキスト精度など RAG 固有の品質指標を自動評価できます。ゴールデンアンサーが不要であり、医学用語の適切さなど定性的評価も高性能モデルが担当するため、1,000 件以上の週次自動評価が実現できます。
D
Amazon CloudWatch カスタムメトリクスで応答時間とエラー率を監視し品質指標として使用する
CloudWatch はシステムの可用性・レイテンシ・エラー率の監視には適していますが、医学的忠実性という回答品質の評価には対応していません。

解説

Amazon Bedrock Model Evaluation は、別の大規模言語モデル(LLM)を「ジャッジ」として使用し、忠実性(Faithfulness:回答がコンテキストに基づいているか)・回答関連性・コンテキスト精度など RAG 固有の品質指標を自動評価できます。ゴールデンアンサーが不要であり、医学用語の適切さなど定性的評価も高性能モデルが担当するため、1,000 件以上の週次自動評価が実現できます。 選択肢A の ROUGE(Recall-Oriented Understudy for Gisting Evaluation)は n-gram 一致率を測定する指標で、要約品質評価に使われますが、「ソースに基づいているか」という RAG の忠実性評価には不適切です。 選択肢B の Exact Match や F1 スコアはゴールデンアンサーとの厳密な比較が前提であり、正解集が存在しない本ケースでは使用できません。 選択肢D の CloudWatch はシステムの可用性・レイテンシ・エラー率の監視には適していますが、医学的忠実性という回答品質の評価には対応していません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る