医療スタートアップがAmazon BedrockでClaude 3 SonnetとAmazon Titan Text Premierのどちらを医療記録の要約タスクに採用するか比較検討しています。
社内には専門家が検証した参照要約1,000件があり、48時間以内に定量的な比較結果を経営陣へ報告する必要があります。
最も適切なAWSのアプローチはどれですか?
A
Amazon Bedrock Model Evaluation ジョブをS3のデータセットとROUGE・BERTScoreメトリクスを用いて実行し、両モデルの要約品質を定量的に比較する
✓ 正解
Amazon Bedrock Model Evaluation は独自データセット(BYOD:Bring Your Own Data)を使用して複数モデルを定量的に比較できる機能を提供します。ROUGEやBERTScoreなどの自動評価メトリクスをサポートし、S3のデータセットを参照してバッチ評価ジョブを実行できます。1,000件のデータを48時間で自動処理し定量レポートを生成できます。