AIFAIとMLの基礎

ある企業は、長文を要約する生成AIモデルを評価しています。生成された要約が、人手で作成した要約とどの程度一致しているかを自動的に評価したいと考えています。この目的に最も適した評価指標はどれですか。

A
ROUGE
✓ 正解
ROUGEは要約タスクの代表的な評価指標です。生成された要約と参照要約の一致度を測定し、重要な情報がどれだけ含まれているかを評価する目的に適しています。
B
BLEU
BLEUは機械翻訳の品質評価で広く利用されます。翻訳と要約はいずれも自然言語処理ですが、要約の評価では一般的にROUGEが利用されます。
C
ROC-AUC
ROC-AUCは分類モデルが陽性と陰性をどれだけ適切に識別できるかを評価する指標です。文章要約の品質を評価する用途には適していません。
D
MAE
MAEは回帰問題における予測値と実測値の平均絶対誤差を評価する指標です。生成された文章の品質や要約の適切さを測定する目的では使用しません。

解説

正解は「ROUGE」です。ROUGE(Recall-Oriented Understudy for Gisting Evaluation)は、文章要約の品質評価で広く利用される指標です。生成された要約と参照要約との単語やn-gramの一致度を比較し、要約として必要な情報がどの程度含まれているかを評価します。一方、BLEUは機械翻訳の評価に用いられる代表的な指標であり、翻訳品質の比較を目的としています。ROC-AUCは分類モデル、MAE(Mean Absolute Error)は回帰モデルの評価指標です。それぞれ用途が異なるため、要約タスクの評価にはROUGEを選択するのが適切です。AWS Certified AI Practitionerでは、AIタスクごとに適切な評価指標を選択できることが重要です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る