AIPテスト、検証、トラブルシューティング

医療機関向けのAIアシスタントをAmazon Bedrock上のClaudeモデルで開発しています。医師の質問に対して医学的根拠に基づく回答を生成し、製品リリース前に品質を評価する必要があります。このユースケースにおいて最も適切な評価戦略はどれですか?

A
ROUGE-L(Recall-Oriented Understudy for Gisting Evaluation:要約評価指標)スコアのみでBedrock Model Evaluationを実行し、スコアが0.7以上の場合にリリース承認する
ROUGE-L単独では医学的正確性を測定できません。
B
Bedrock Model EvaluationでBERTScore(BERTを使った意味的類似度評価指標)による自動評価を実施した後、医師・医学専門家による人間評価を組み合わせてファクトチェックと安全性確認を行う
✓ 正解
医療AIは患者の健康に直接影響するため、自動メトリクスだけでは不十分です。BERTScoreは意味的類似性を捉えますが、医学的正確性の保証には専門家評価が必須です。Bedrock Model Evaluationはカスタム評価セットで自動評価を効率化し、その後の医師レビューで事実確認と安全性を担保します。
C
Bedrock PlaygroundでA/Bテストを実施し、ユーザー満足度スコアのみで品質判断する
Bedrock PlaygroundでのA/Bテストのみでは事実誤謬を検出できません。
D
Perplexity(困惑度:言語モデルの予測難しさを示す指標)とBLEU(機械翻訳品質評価指標)スコアの組み合わせで自動評価し、コスト削減のため専門家レビューを省略する
Perplexity・BLEU単独では医学的正確性を測定できず、専門家レビューなしでは医療用途に不適切です。

解説

医療AIは患者の健康に直接影響するため、自動メトリクスだけでは不十分です。BERTScoreは意味的類似性を捉えますが、医学的正確性の保証には専門家評価が必須です。Bedrock Model Evaluationはカスタム評価セットで自動評価を効率化し、その後の医師レビューで事実確認と安全性を担保します。 選択肢AのROUGE-L単独では医学的正確性を測定できません。 選択肢CのBedrock PlaygroundでのA/Bテストのみでは事実誤謬を検出できません。 選択肢DのPerplexity・BLEU単独では医学的正確性を測定できず、専門家レビューなしでは医療用途に不適切です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIP の問題一覧に戻る