AIF基盤モデルのアプリケーション
ある企業が、複数のビジネス要件に対してAmazon Bedrockのどの基盤モデルを採用するかを選定しています。採用前に各モデルの応答品質・有害性・頑健性(ロバストネス)を同一のプロンプトセットで体系的に比較・評価したいと考えています。この目的に最も直接的に対応するAmazon Bedrockの機能はどれですか?
AAmazon Bedrock Guardrails(生成AIアプリケーションの出力に安全ポリシーを適用するフィルタリング機能)
Guardrailsは出力フィルタリング用のサービスであり、モデル比較・評価には対応していません。
BAmazon Bedrock モデル評価(Model Evaluation)(定義した指標で複数モデルの品質を自動比較)
✓ 正解
Amazon Bedrockのモデル評価(Model Evaluation)機能は、複数の基盤モデルを同一のプロンプトセットで評価し、正確性・有害性・頑健性(ロバストネス)・流暢性などの指標でスコアを比較できます。自動評価と人間によるレビューの両方をサポートします。
CAmazon SageMaker Clarify(機械学習モデルのバイアス検出と説明可能性の分析ツール)
SageMaker Clarifyはバイアス・説明可能性分析が主目的であり、LLMの複数モデル品質比較には適していません。
DAmazon SageMaker Model Monitor(本番デプロイ済みモデルのデータドリフトを継続監視するツール)
SageMaker Model Monitorは本番デプロイ済みモデルの継続監視が主目的であり、複数モデルの事前評価には対応していません。
解説
Amazon Bedrockのモデル評価(Model Evaluation)機能は、複数の基盤モデルを同一のプロンプトセットで評価し、正確性・有害性・頑健性(ロバストネス)・流暢性などの指標でスコアを比較できます。自動評価と人間によるレビューの両方をサポートします。
選択肢AのGuardrailsは出力フィルタリング用のサービスであり、モデル比較・評価には対応していません。
選択肢CのSageMaker Clarifyはバイアス・説明可能性分析が主目的であり、LLMの複数モデル品質比較には適していません。
選択肢DのSageMaker Model Monitorは本番デプロイ済みモデルの継続監視が主目的であり、複数モデルの事前評価には対応していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →