無限ノック › AIF 練習問題一覧 › 問題
AIF基盤モデルのアプリケーション

ある企業が Amazon Bedrock でカスタマイズした基盤モデルをカスタマーサービスの自動応答に本番導入する前に、モデルの応答を「正確性」「有害コンテンツのなさ」「一貫性」などの観点で体系的に評価したいと考えています。自動評価と人手評価の両方をサポートする、この目的に最も適した AWS のサービス・機能はどれですか?

A
Amazon SageMaker Model Monitor を使用して本番稼働後のモデルドリフトを継続的に監視する
SageMaker Model Monitorは本番稼働後にデータドリフトやモデルドリフトを継続監視するサービスであり、本番導入前の応答品質評価(正確性・有害性・一貫性)には対応していません。
B
Amazon Bedrock Model Evaluation を使用して自動指標または人手レビューによる評価を実施する
✓ 正解
Bedrock Model Evaluationは自動指標(ROUGE・BERTScoreなど)と人手レビュー(AWS Managed Workforce・社内チーム)の両方をサポートし、正確性・有害性・一貫性などを本番導入前に体系的に評価できます。
C
Amazon CloudWatch Logs Insights で推論ログを収集しカスタムダッシュボードを作成する
CloudWatch Logs Insightsは推論ログを収集してダッシュボードで可視化できますが、応答の正確性・有害性・一貫性を自動評価したり人手レビューを組み込む専用機能は持ちません。
D
Amazon SageMaker Clarify でモデルのバイアス検出と説明可能性レポートを生成する
SageMaker Clarifyはモデルのバイアス検出(公平性分析)と予測の説明可能性(SHAP値など)に特化しており、有害コンテンツや回答の正確性・一貫性の網羅的評価には適していません。

解説

Amazon Bedrock Model Evaluation は、基盤モデルの応答品質を本番導入前に体系的に評価する専用機能です。自動評価では ROUGE(テキスト要約品質指標)や BERTScore(意味的類似度指標)などを使用し、人手評価では AWS Managed Workforce(Mechanical Turk)や社内チームによるレビューを設定できます。正確性・有害性・頑健性・一貫性を評価でき、モデル比較にも活用できます。 選択肢Aの SageMaker Model Monitor は、本番稼働後にデータドリフトやモデルドリフトを継続監視するサービスであり、本番導入前の応答品質評価には対応していません。 選択肢Cの CloudWatch Logs Insights は、推論ログを収集してカスタムダッシュボードを作成できますが、正確性・有害性などの体系的な品質評価機能は持ちません。 選択肢Dの SageMaker Clarify は、バイアス検出と説明可能性レポートの生成に特化したサービスであり、正確性・有害コンテンツ・一貫性の網羅的評価には適していません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る