AIPテスト、検証、トラブルシューティング
医療系スタートアップが、医師の診断レポートを要約するシステムの基盤モデルを選定しています。評価基準は「事実の正確性」「医学用語の適切な使用」「要約の簡潔さ」の3軸です。5,000件の参照サマリーが用意されており、1週間以内に評価を完了する必要があります。3つのモデル候補(Claude 3 Sonnet、Amazon Titan Text Premier、Llama 3 70B)を評価する最も効果的なアプローチはどれですか?
AAmazon Bedrock Model Evaluationの自動評価のみを使用し、ROUGEスコアで3モデルを全5,000件比較して最高スコアのモデルを最終選定する
ROUGE/BERTScoreなどの自動指標は大量データを効率的に評価できますが、医学用語の臨床的適切性を判断する能力がないため、3つの評価軸をすべてカバーすることができません。
B医師チームによる完全な人間評価を全5,000件に対して実施し、事実性・医学用語・簡潔さの各軸を5段階で採点してモデルを選定する
精度の高い人間評価が実施できますが、5,000件全件を1週間以内で完了することは現実的でなく、コストと時間の両面で制約を満たせません。
CAmazon Bedrock Model Evaluationで5,000件を自動評価して上位2モデルに絞り込み、医師による200件のサンプルで医学用語の適切性を人間評価して最終選定する
✓ 正解
自動評価で候補モデルを絞り込んだうえで、コストのかかる人間評価をサンプルに集中させる段階的アプローチにより、期限内に3つの評価軸すべてをカバーできます。
DAmazon Bedrock Playgroundで各モデルを50件程度インタラクティブにテストし、開発チームの主観的な合意でモデルを選定する
50件程度のインタラクティブテストは統計的信頼性が不十分であり、開発チームの主観的合意に基づく選定では評価の再現性と客観性を確保できません。
解説
自動評価(ROUGE/BERTScore)は大規模データセットに対して迅速かつ安価に事実性・簡潔さを定量測定できますが、医学用語の臨床的適切性は専門知識が必要なため人間評価が必須です。段階的評価により自動評価でモデルを絞り込み、コストのかかる人間評価を最小サンプルに集中させることで期限内に高品質な評価が実現できます。
選択肢AのAmazon Bedrock Model Evaluation自動評価のみでは医学的適切性を測定できず、3つの評価軸をすべてカバーできません。
選択肢Bの医師チームによる5,000件全件の人間評価は、1週間以内での完了が困難です。
選択肢DのAmazon Bedrock Playgroundによるインタラクティブテストは主観的で統計的信頼性がありません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →