AIPテスト、検証、トラブルシューティング
ニュースメディア企業が Amazon Bedrock を使用して長文記事の要約生成サービスを構築し、Amazon Bedrock Model Evaluation で自動評価を実施予定です。評価チームは「生成された要約が参照要約と異なる語彙・表現を使っていても、同じ事実を伝えている(パラフレーズ)場合を適切に高評価したい」と要求しています。最も適切な自動評価メトリクスはどれですか?
AROUGE-1 スコア。単語レベルの一致を測定するため、事実の有無を簡易的に検出できる
ROUGE-1はユニグラム(単語)の一致率を測定するため、同じ意味でも異なる語彙を使ったパラフレーズはスコアが低くなります。文字列の表層一致に依存するため意味的同等性を捉えることができず、パラフレーズ評価には不向きです。
BROUGE-L スコア。最長共通部分列(LCS)を使用して語順を考慮した評価が可能なため
ROUGE-Lは最長共通部分列(LCS)に基づき語順を考慮したトークン一致を測定しますが、完全なトークン一致を前提とするため語彙が異なるパラフレーズを意味的に同等と評価することはできず、多様な表現を許容する要約評価には不十分です。
CBERTScore。文脈埋め込みを用いてトークン間の意味的類似度を測定し、パラフレーズを適切に評価できるため
✓ 正解
BERTScoreはBERT系モデルの文脈埋め込みを用いてトークン間のコサイン類似度を計算し、語彙が異なっても意味が同等なパラフレーズを高く評価できます。多様な表現が許容されるニュース要約の自動評価メトリクスとして最も適切です。
D完全一致(Exact Match)スコア。要約の正確性を厳密に測定できるため
完全一致(Exact Match)スコアは生成テキストと参照テキストが文字列として完全に一致する場合のみ満点となり、表現が少しでも異なれば0点になります。要約では表現の多様性が当然生じるためこのメトリクスは要約品質の評価に根本的に不適切です。
解説
BERTScore は BERT 系モデルの文脈埋め込みを使用して生成テキストと参照テキストのトークン間コサイン類似度を計算します。語彙が異なっても意味が同等のパラフレーズを高く評価できるため、多様な表現が許容されるニュース要約の評価に最適です。
選択肢Aの ROUGE-1 スコアは単語レベルのユニグラム一致率を測定するため、異なる語彙を使ったパラフレーズは同じ意味でも低評価となり、意味的同等性を捉えられません。
選択肢Bの ROUGE-L スコアは最長共通部分列(LCS)に基づきトークン一致を測定するもので、語順は考慮しますが完全なトークン一致を前提とするため、語彙が異なるパラフレーズの意味的同等性を適切に評価できません。
選択肢Dの完全一致(Exact Match)スコアは生成テキストと参照テキストが文字列として完全に一致する場合にのみ満点となるため、表現が少しでも異なれば0点となり、多様な語彙・表現が許容されるニュース要約の評価指標として根本的に不適切です。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIPを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →