AIF基盤モデルのアプリケーション
ML チームが、顧客メールの要約タスクに対して Amazon Bedrock 上の複数の基盤モデルを比較評価したいと考えています。ROUGE スコア(Recall-Oriented Understudy for Gisting Evaluation:テキスト要約の品質を測る自動評価指標)などの自動評価指標を使って客観的に比較したい場合、どの AWS 機能を使用すべきですか?
AAmazon SageMaker Model Monitor
SageMaker Model Monitorは本番環境でのモデルドリフト(精度低下)の継続的な監視に特化しており、複数モデルの評価・比較には向きません。
BAmazon Bedrock Model Evaluation
✓ 正解
Amazon Bedrock Model Evaluation を使用すると、複数の基盤モデルを同じデータセットで評価・比較できます。ROUGE などの自動評価指標と人間フィードバックの両方をサポートしています。
CAmazon SageMaker Clarify
Amazon SageMaker Clarifyはモデルのバイアスと説明可能性の分析に特化しており、複数の基盤モデルの品質を比較評価する機能には向いていません。
DAmazon CloudWatch Metrics
Amazon CloudWatch Metricsは汎用的なメトリクス収集・監視サービスであり、基盤モデルの品質評価機能や複数モデル比較の専門的な機能を提供していません。
解説
Amazon Bedrock Model Evaluation
Amazon Bedrock Model Evaluation を使用すると、複数の基盤モデルを同じデータセットで評価・比較できます。ROUGE などの自動評価指標や人間によるフィードバックを使った評価の両方をサポートしています。SageMaker Model Monitor は本番環境でのモデルドリフト監視、Clarify はバイアス・説明可能性の分析に特化しています。
CloudWatch は汎用的なメトリクス収集サービスであり基盤モデルの品質評価機能はありません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →