無限ノック › AIP 練習問題一覧 › 問題
AIP基盤モデルの統合、データ管理、コンプライアンス

医療スタートアップがAmazon BedrockでClaude 3 SonnetとAmazon Titan Text Premierのどちらを医療記録の要約タスクに採用するか比較検討しています。 社内には専門家が検証した参照要約1,000件があり、48時間以内に定量的な比較結果を経営陣へ報告する必要があります。 最も適切なAWSのアプローチはどれですか?

A
Amazon Bedrock Model Evaluation ジョブをS3のデータセットとROUGE・BERTScoreメトリクスを用いて実行し、両モデルの要約品質を定量的に比較する
✓ 正解
Amazon Bedrock Model Evaluation は独自データセット(BYOD:Bring Your Own Data)を使用して複数モデルを定量的に比較できる機能を提供します。ROUGEやBERTScoreなどの自動評価メトリクスをサポートし、S3のデータセットを参照してバッチ評価ジョブを実行できます。1,000件のデータを48時間で自動処理し定量レポートを生成できます。
B
Amazon SageMaker Clarify を使用して両モデルをエンドポイントにデプロイし、バイアス検出と説明可能性レポートを生成することで要約品質を比較する
Amazon SageMaker Clarify はバイアス・公平性分析向けであり、テキスト要約の品質比較には適していません。
C
AWS Glue と Amazon Athena を使用して評価データのETLパイプラインを構築・集計し、カスタムスクリプトで定量的な比較レポートを自動生成する
AWS Glue と Amazon Athena を使用した評価データ管理・集計は、カスタムスクリプト実装が必要であり、定量的なモデル比較専用ツールではありません。
D
Amazon Bedrock Playground で各モデルに対して50件ずつサンプルテストを実施し、担当者が評価ルーブリックに基づいて主観的に品質を評価する
Playground での手動評価は大量データの処理に非効率です。

解説

Amazon Bedrock Model Evaluation は独自データセット(BYOD:Bring Your Own Data)を使用して複数モデルを定量的に比較できる機能を提供します。ROUGE(テキスト重複ベースの評価指標)やBERTScore(意味的類似度評価指標)などの自動評価メトリクスをサポートし、S3のデータセットを参照してバッチ評価ジョブを実行できます。1,000件のデータを48時間で自動処理し定量レポートを生成できます。 選択肢BのAmazon SageMaker Clarify はバイアス・公平性分析向けであり、テキスト要約の品質比較には適していません。 選択肢CのAWS Glue と Amazon Athena を使用した評価データ管理・集計は、カスタムスクリプト実装が必要であり、定量的なモデル比較専用ツールではありません。 選択肢DのPlayground での手動評価は大量データの処理に非効率です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIP の問題一覧に戻る