AIFAIとMLの基礎

生成AIの回答品質を評価する際、BLEUよりBERTScoreを採用する利点として最も適切なものはどれですか。

A
意味が同じであれば異なる表現でも高く評価できる
✓ 正解
BERTScoreは意味的な類似性を評価するため、単語が一致しなくても意味が近ければ高く評価できます。生成AIの評価で大きな利点となります。
B
分類問題のAccuracyを同時に計算できる
Accuracyは分類問題の評価指標です。BERTScoreは文章同士の意味的な類似性を評価するものであり、Accuracyを算出する機能はありません。
C
回帰モデルの予測誤差も同時に評価できる
回帰モデルの誤差はRMSEやMAEなどで評価します。BERTScoreは生成テキストの品質評価を目的とした指標です。
D
推論速度を高速化できる
BERTScoreは評価指標であり、モデルの推論速度を改善する技術ではありません。評価方法と推論性能は別の概念です。

解説

正解は「意味が同じであれば異なる表現でも高く評価できる」です。BERTScoreは事前学習済み言語モデルの埋め込み表現を利用して意味的な類似度を評価するため、言い換えや自然な表現の違いにも対応できます。一方、BLEUは単語列の一致度を重視するため、意味が同じでも異なる表現では低いスコアになることがあります。生成AIでは自然な言い換えが多く発生するため、BERTScoreが利用される場面が増えています。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る