AIFAIとMLの基礎

ある企業は、生成AIによる製品説明文を評価しています。生成文と正解文で使用されている単語は異なりますが、意味はほぼ同じです。単語の一致だけでなく、意味的な類似性を考慮して評価したい場合、最も適切な評価指標はどれですか。

A
BERTScore
✓ 正解
BERTScoreは単語の一致だけでなく、BERTの埋め込み表現を利用して意味的な近さを評価します。言い換え表現にも対応できるため、生成AIの評価に適しています。
B
BLEU
BLEUは翻訳評価で広く利用されますが、主にn-gramの一致率を評価します。同じ意味でも異なる表現の場合、スコアが低くなることがあります。
C
Accuracy(正解率)
Accuracyは分類問題の正解率を表す指標です。文章同士の意味的な類似性を評価する目的には利用されません。
D
RMSE
RMSEは回帰モデルの予測誤差を評価する指標です。生成された文章の品質や意味の近さを測定する用途ではありません。

解説

正解は「BERTScore」です。BERTScoreはBERTなどの事前学習済み言語モデルを利用し、生成文と参照文の意味的な類似度を評価する指標です。単語が完全に一致しなくても意味が近ければ高いスコアとなるため、生成AIの評価に適しています。 選択肢B(BLEU)はn-gramの一致度を評価するため、言い換え表現では低いスコアになることがあり、意味的類似性の評価には不向きです。 選択肢C(Accuracy)は分類問題の正解率を表す指標であり、文章同士の意味的な類似性を評価する目的には利用されません。 選択肢D(RMSE)は回帰モデルの予測誤差を評価する指標であり、生成された文章の品質や意味の近さを測定する用途ではありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る