ある企業は、生成AIによる製品説明文を評価しています。生成文と正解文で使用されている単語は異なりますが、意味はほぼ同じです。単語の一致だけでなく、意味的な類似性を考慮して評価したい場合、最も適切な評価指標はどれですか。
正解は「BERTScore」です。BERTScoreはBERTなどの事前学習済み言語モデルを利用し、生成文と参照文の意味的な類似度を評価する指標です。単語が完全に一致しなくても意味が近ければ高いスコアとなるため、生成AIの評価に適しています。 選択肢B(BLEU)はn-gramの一致度を評価するため、言い換え表現では低いスコアになることがあり、意味的類似性の評価には不向きです。 選択肢C(Accuracy)は分類問題の正解率を表す指標であり、文章同士の意味的な類似性を評価する目的には利用されません。 選択肢D(RMSE)は回帰モデルの予測誤差を評価する指標であり、生成された文章の品質や意味の近さを測定する用途ではありません。