AIF基盤モデルのアプリケーション
あるチームがAmazon Bedrockの基盤モデルを使ってニュース記事の自動要約機能を構築しました。生成された要約が、人間が作成した参照要約とどれだけ語句が重複しているかを定量的に評価したいと考えています。この目的に最も適した評価指標はどれですか。
A分類モデルの予測における適合率と再現率の調和平均であるF1スコア
適合率と再現率を統合した分類タスク向けの指標であり、要約と参照テキストの語句重複を測る用途には合致しない。
B回帰モデルの予測値と実測値の誤差を測る平均二乗誤差(MSE)
数値を予測する回帰モデルの誤差を測る指標であり、テキスト要約の語句重複を定量化する評価には適さない。
C生成テキストと参照テキストのn-gram重複を測定するROUGEスコア
✓ 正解
生成要約と参照要約のn-gramやシーケンスの重複度を測る指標で、要約タスクの自動評価の標準であり、参照との語句一致を定量化する要件に直接適合する。
Dレコメンデーションの順位品質を評価する指標であるnDCG
検索結果や推薦の順位品質を評価する指標であり、要約テキストの重複度を測る目的には用いられない。
解説
ROUGE(Recall-Oriented Understudy for Gisting Evaluation)は、生成された要約と人間による参照要約の間でn-gram(連続する語句)やシーケンスの重複度を測る指標で、要約タスクの自動評価で広く使われます。
参照要約との語句一致を定量化したいという要件に直接適合します。
選択肢のF1スコアは分類タスクの適合率と再現率を統合する指標で、要約の語句重複評価には用いない。
選択肢の平均二乗誤差(MSE)は数値予測(回帰)の誤差指標で、テキスト要約の評価には適さない。
選択肢のnDCGはランキング・推薦の順位品質を評価する指標で、要約の重複度評価には用いない。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →