AIF責任あるAIのガイドライン
ある企業が Amazon Bedrock を使用して社内向け生成AIアシスタントを開発しています。本番リリース前に、生成されるテキストの有害性・偏見・事実的正確性などを責任あるAIの観点から体系的に評価し、異なるモデル設定(プロンプト・モデルの種類など)を定量的に比較したいと考えています。この目的に最も適した AWS の機能はどれですか?
AAmazon Bedrock Guardrails
Amazon Bedrock Guardrailsは本番稼働中にリアルタイムでコンテンツをフィルタリングする実行時保護の仕組みであり、リリース前の体系的評価ツールではありません。
BAmazon Bedrock Model Evaluation
✓ 正解
Amazon Bedrock Model Evaluation は基盤モデルの出力を有害性・事実精度・ロバスト性・バイアスなどの指標で体系的に評価する機能です。自動評価と人間によるレビューの両方に対応し、複数のモデル設定を比較できるため、リリース前の品質評価に最適です。
CAmazon SageMaker Clarify
Amazon SageMaker Clarifyは従来型MLモデルのバイアス分析・説明可能性に特化したサービスであり、基盤モデルのテキスト生成品質評価には適していません。
DAmazon CloudWatch Logs Insights
Amazon CloudWatch Logs Insightsはログ分析ツールであり、有害性や偏見といったモデル出力の品質指標を評価する機能はありません。
解説
Amazon Bedrock Model Evaluation は基盤モデルの出力を有害性・事実精度・ロバスト性・バイアスなどの指標で体系的に評価する機能です。自動評価と人間によるレビューの両方に対応し、複数のモデル設定を比較できるため、リリース前の品質評価に最適です。
選択肢AのAmazon Bedrock Guardrailsは本番稼働中にリアルタイムでコンテンツをフィルタリングする実行時保護の仕組みであり、リリース前の体系的評価ツールではありません。
選択肢CのAmazon SageMaker Clarifyは従来型MLモデルのバイアス分析・説明可能性に特化したサービスであり、基盤モデルのテキスト生成品質評価には適していません。
選択肢DのAmazon CloudWatch Logs Insightsはログ分析ツールであり、有害性や偏見といったモデル出力の品質指標を評価する機能はありません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →