医療アナリティクス企業がAmazon Bedrockを使用した臨床意思決定支援チャットボットを構築しています。コンプライアンス責任者は、選択した基盤モデルが患者の年齢・性別・民族などの人口統計に基づいて差別的な推奨を生成しないことを証明するよう求めています。これをスケーラブルかつ繰り返し実行可能なプロセスとしてAWSサービスで実現する必要があります。次のうち最も適切なアプローチはどれですか?
人口統計バイアスの評価には、テキスト類似度ではなく意味的公平性を判断できる人間評価が最適です。Bedrock Model Evaluationの人間評価ワークフローでは、評価基準(ルーブリック)をカスタム定義して評価者が公平性の観点でレスポンスを採点できます。人口統計のみを変えた対照テストプロンプトを使うことで、差別的推奨を体系的に検出できます。 選択肢AのROUGE-LとBERTScoreはテキストの重複度・意味的類似度を測定するメトリクスであり、グループ間でスコアが異なっても公平性の問題を示すわけではなく、臨床バイアスを検出できません。 選択肢CのAmazon SageMaker Clarifyは従来の教師あり機械学習モデルのトレーニングデータや予測値のバイアス分析用ツールで、Bedrockの基盤モデル出力評価とは統合されておらず生成AIのバイアス評価には適用できません。 選択肢Dの本番デプロイ後にデータを収集する方式では、評価完了前に患者が不公平な推奨にさらされるリスクがあり、医療系コンプライアンス上許容できません。