AIP基盤モデルの統合、データ管理、コンプライアンス
製薬会社が Amazon Bedrock を使用して医薬品添付文書から副作用情報を抽出・回答する RAG システムを本番稼働させています。品質評価には以下の要件があります:
・回答がソースドキュメントの記述に正確に基づいているか(忠実性)を評価したい
・医学用語の適切な使用を評価したい
・週次で 1,000 件以上の評価を自動化したい
・ゴールデンアンサーセット(正解集)が存在しない
この状況で最も適切な評価アプローチはどれですか?
AROUGE-L スコアを使用して生成された回答と元のソース文書を比較する
ROUGE(Recall-Oriented Understudy for Gisting Evaluation)は n-gram 一致率を測定する指標で、要約品質評価に使われますが、「ソースに基づいているか」という RAG の忠実性評価には不適切です。
BExact Match および F1 スコアで生成回答の品質を自動評価する
Exact Match や F1 スコアはゴールデンアンサーとの厳密な比較が前提であり、正解集が存在しない本ケースでは使用できません。
CAmazon Bedrock Model Evaluation の LLM ジャッジ機能で Claude などの高性能モデルを評価者として忠実性・関連性を採点させる
✓ 正解
Amazon Bedrock Model Evaluation は、別の大規模言語モデル(LLM)を「ジャッジ」として使用し、忠実性(Faithfulness:回答がコンテキストに基づいているか)・回答関連性・コンテキスト精度など RAG 固有の品質指標を自動評価できます。ゴールデンアンサーが不要であり、医学用語の適切さなど定性的評価も高性能モデルが担当するため、1,000 件以上の週次自動評価が実現できます。
DAmazon CloudWatch カスタムメトリクスで応答時間とエラー率を監視し品質指標として使用する
CloudWatch はシステムの可用性・レイテンシ・エラー率の監視には適していますが、医学的忠実性という回答品質の評価には対応していません。
解説
Amazon Bedrock Model Evaluation は、別の大規模言語モデル(LLM)を「ジャッジ」として使用し、忠実性(Faithfulness:回答がコンテキストに基づいているか)・回答関連性・コンテキスト精度など RAG 固有の品質指標を自動評価できます。ゴールデンアンサーが不要であり、医学用語の適切さなど定性的評価も高性能モデルが担当するため、1,000 件以上の週次自動評価が実現できます。
選択肢A の ROUGE(Recall-Oriented Understudy for Gisting Evaluation)は n-gram 一致率を測定する指標で、要約品質評価に使われますが、「ソースに基づいているか」という RAG の忠実性評価には不適切です。
選択肢B の Exact Match や F1 スコアはゴールデンアンサーとの厳密な比較が前提であり、正解集が存在しない本ケースでは使用できません。
選択肢D の CloudWatch はシステムの可用性・レイテンシ・エラー率の監視には適していますが、医学的忠実性という回答品質の評価には対応していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →