医療機関向けのAIアシスタントをAmazon Bedrock上のClaudeモデルで開発しています。医師の質問に対して医学的根拠に基づく回答を生成し、製品リリース前に品質を評価する必要があります。このユースケースにおいて最も適切な評価戦略はどれですか?
医療AIは患者の健康に直接影響するため、自動メトリクスだけでは不十分です。BERTScoreは意味的類似性を捉えますが、医学的正確性の保証には専門家評価が必須です。Bedrock Model Evaluationはカスタム評価セットで自動評価を効率化し、その後の医師レビューで事実確認と安全性を担保します。 選択肢AのROUGE-L単独では医学的正確性を測定できません。 選択肢CのBedrock PlaygroundでのA/Bテストのみでは事実誤謬を検出できません。 選択肢DのPerplexity・BLEU単独では医学的正確性を測定できず、専門家レビューなしでは医療用途に不適切です。