無限ノック › AIP 練習問題一覧 › 問題
AIPAIの安全性、セキュリティ、ガバナンス

医療アナリティクス企業がAmazon Bedrockを使用した臨床意思決定支援チャットボットを構築しています。コンプライアンス責任者は、選択した基盤モデルが患者の年齢・性別・民族などの人口統計に基づいて差別的な推奨を生成しないことを証明するよう求めています。これをスケーラブルかつ繰り返し実行可能なプロセスとしてAWSサービスで実現する必要があります。次のうち最も適切なアプローチはどれですか?

A
Amazon Bedrock Model Evaluationの自動評価ワークフローを使用し、ROUGE-LおよびBERTScoreメトリクスで人口統計的に多様なテストデータセットを評価し、グループ間の出力類似度を測定する
ROUGE-LとBERTScoreはテキストの重複度・意味的類似度を測定するメトリクスです。グループ間でスコアが異なっても、それが公平性の問題を示すわけではなく、臨床バイアスを検出する能力がありません。
B
Amazon Bedrock Model Evaluationの人間評価ワークフローを使用し、臨床状態を同一にしながら患者の人口統計のみを変えたテストプロンプトで、人口統計的公平性(Demographic Parity:人口統計グループ間でモデル出力が均等であるかを測る指標)を評価するカスタム評価基準(ルーブリック)を作成する
✓ 正解
人口統計バイアスの評価には意味的公平性を判断できる人間評価が最適です。人間評価ワークフローで公平性のルーブリックをカスタム定義し、人口統計のみを変えた対照プロンプトを採点することで差別的推奨を体系的に検出できます。
C
Amazon SageMaker Clarifyを使用して基盤モデルの特徴重要度を分析し、バイアスレポートを生成する
Amazon SageMaker Clarifyは従来の教師あり機械学習モデルのトレーニングデータや予測値のバイアス分析用ツールです。Amazon Bedrockの基盤モデル出力評価とは統合されておらず、生成AIのバイアス評価には適用できません。
D
モデルを本番環境にデプロイして30日間の運用データを収集し、Amazon QuickSightで人口統計別のレスポンス分布を可視化する
本番デプロイ後にデータを収集する方式では、評価完了前に患者が不公平な推奨にさらされるリスクがあり、医療系コンプライアンス上許容できません。事前の評価プロセスが必要です。

解説

人口統計バイアスの評価には、テキスト類似度ではなく意味的公平性を判断できる人間評価が最適です。Bedrock Model Evaluationの人間評価ワークフローでは、評価基準(ルーブリック)をカスタム定義して評価者が公平性の観点でレスポンスを採点できます。人口統計のみを変えた対照テストプロンプトを使うことで、差別的推奨を体系的に検出できます。 選択肢AのROUGE-LとBERTScoreはテキストの重複度・意味的類似度を測定するメトリクスであり、グループ間でスコアが異なっても公平性の問題を示すわけではなく、臨床バイアスを検出できません。 選択肢CのAmazon SageMaker Clarifyは従来の教師あり機械学習モデルのトレーニングデータや予測値のバイアス分析用ツールで、Bedrockの基盤モデル出力評価とは統合されておらず生成AIのバイアス評価には適用できません。 選択肢Dの本番デプロイ後にデータを収集する方式では、評価完了前に患者が不公平な推奨にさらされるリスクがあり、医療系コンプライアンス上許容できません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る