無限ノック › AIP 練習問題一覧 › 問題
AIPテスト、検証、トラブルシューティング

あるヘルスケアスタートアップが、Amazon Bedrock(Claude)を使った医療 Q&A システムをリリース前に評価しています。回答の「臨床的正確性」と「患者安全性」を体系的に測定する必要がありますが、ROUGE・BLEU などの自動メトリクスや LLM-as-judge では臨床的な正誤の判断が困難です。社内の医師チームにモデル応答をレビューさせ、専門的な評価基準で採点する体系的なワークフローを構築したいと考えています。AWS のサービスを使って再現可能なヒューマン評価を実施するには、どのアプローチが最も適切ですか?

A
Amazon Bedrock Model Evaluation のヒューマン評価ジョブを設定し、AWS IAM Identity Center で管理した医師チームをレビュアーとして割り当てる
✓ 正解
Amazon Bedrock Model Evaluation のヒューマン評価ジョブは、IAM Identity Center で認証された社内専門家をレビュアーとして指定し、プロンプト/応答セットを構造化ワークフローで体系的に評価できます。臨床的正確性のような専門的判断が必要な基準でも再現可能な評価が実施でき、今回の要件に最も合致します。
B
Amazon SageMaker Ground Truth で医師チームのプライベートワークフォースを構成し、Bedrock の出力をアノテーションタスクとして配信する
Amazon SageMaker Ground Truth は機械学習モデルの学習データ作成・アノテーションに特化したサービスです。生成 AI モデルの推論品質を評価する体系的なフレームワークとしては設計されておらず、Bedrock 応答の評価専用 UI や結果集計機能も持ちません。
C
Amazon Augmented AI(A2I)のカスタムヒューマンレビューワークフローを Bedrock 呼び出しの後段に配置し、信頼スコアが閾値を下回った応答を医師にルーティングして本番評価を行う
Amazon Augmented AI(A2I)は本番稼働中の推論パイプラインに組み込み、信頼スコアが低い応答をリアルタイムで人間にエスカレーションする仕組みです。リリース前に一定のプロンプトセットを体系的にオフライン評価するモデル評価フレームワークとは目的が異なります。
D
Bedrock Model Evaluation の自動評価ジョブをタスクタイプ「カスタムプロンプト」で設定し、算出されたスコアを医師チームが個別に解釈・判定する
Bedrock Model Evaluation の自動評価ジョブは ROUGE・BERTScore などの計算可能なメトリクスを算出しますが、臨床的正確性や患者安全性は自動メトリクスでは評価できません。算出スコアを医師が個別解釈する手法では再現性・体系性が欠け、ヒューマン評価ジョブの代替にはなりません。

解説

Amazon Bedrock Model Evaluation はモデル応答品質を体系的に測定する評価フレームワークであり、ヒューマン評価ジョブでは AWS IAM Identity Center を通じて管理された社内専門家をレビュアーとして設定できます。評価対象のプロンプト/応答セットをジョブとして実行し、レビュアーが専用 UI 上で評価基準に従い採点する構造化ワークフローが提供されます。臨床的正確性のような自動計算が困難な基準でも、ヒューマン評価ジョブを使えば体系的かつ再現可能な評価が実施できます。 選択肢BのAmazon SageMaker Ground Truthは機械学習用の学習データ作成・アノテーションに特化したサービスであり、モデルの推論品質を評価するフレームワークとしての設計ではありません。 選択肢CのAmazon Augmented AI(A2I)は本番推論時の信頼スコアに基づくリアルタイムヒューマンレビューを目的としており、オフラインでの体系的なリリース前評価とは用途が異なります。 選択肢DのBedrock Model Evaluation自動評価ジョブは LLM ベースのメトリクスを算出しますが、臨床的正確性は自動計算できないため、医師による手動解釈を追加してもヒューマン評価ジョブの代替にはなりません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る