AIPテスト、検証、トラブルシューティング
ある報道機関は Amazon Bedrock を使用して記事の自動要約システムを構築しました。品質評価のため、人手による評価者を使わず参照要約との比較でモデルを自動評価したいと考えています。評価担当者は、単純な単語の表面的な一致率ではなく、生成された要約が意味的に同等の内容を含んでいるかを測定することを最優先しています。Amazon Bedrock Model Evaluation で利用できる評価指標のうち、この要件に最も適切なものはどれですか?
AROUGE-1(ユニグラムの単語重複に基づく適合率・再現率の評価指標)
ROUGE-1はユニグラムの単語重複に基づく指標で、表層的な一致に依存します。
BROUGE-L(最長共通部分列を用いて文の流暢さを考慮した評価指標)
ROUGE-Lは最長共通部分列を用いた指標ですが、言い換えや同義表現を正しく評価できません。
CBERTScore(事前学習済みBERT系モデルの文脈的埋め込みベクトルを用いた意味的類似度評価指標)
✓ 正解
BERTScoreはBERT等の事前学習済みTransformerモデルの文脈的埋め込みを使用して意味的類似度を計測します。参照要約との比較で生成要約の意味的同等性を評価するために最適です。
DExact Match(モデル出力と参照テキストの完全一致率を計測する評価指標)
Exact Matchはモデル出力と参照テキストの完全一致率を計測するため、意味的類似度の評価には適していません。
解説
BERTScoreはBERT等の事前学習済みTransformerモデルの文脈的埋め込みを使用して意味的類似度を計測します。参照要約との比較で生成要約の意味的同等性を評価するために最適です。
選択肢AのROUGE-1はユニグラムの単語重複に基づく指標で、表層的な一致に依存します。
選択肢BのROUGE-Lは最長共通部分列を用いた指標ですが、言い換えや同義表現を正しく評価できません。
選択肢DのExact Matchはモデル出力と参照テキストの完全一致率を計測するため、意味的類似度の評価には適していません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →