AIFAIとMLの基礎

機械翻訳モデルAとBを比較しています。モデルAはBLEUスコアが高く、モデルBはBERTScoreが高い結果となりました。この結果から最も適切に読み取れる内容はどれですか。

A
モデルBは参照訳と異なる表現でも意味が近い翻訳を生成している可能性がある
✓ 正解
BERTScoreは意味的な類似性を評価するため、単語が一致していなくても内容が近ければ高いスコアになります。表現が異なっていても意味的に近い翻訳を高評価します。
B
モデルBは必ずモデルAより翻訳品質が低い
BLEUとBERTScoreは評価基準が異なります。BLEUが低いからといって翻訳品質が必ず低いとは判断できません。
C
モデルAは回帰問題でより高い精度を示している
BLEUやBERTScoreは自然言語処理の評価指標であり、回帰問題とは関係ありません。そのため、この解釈は誤りです。
D
モデルBは分類問題に特化したモデルである
BERTScoreは評価指標であり、モデルの種類を示すものではありません。分類問題専用という性質もありません。

解説

正解は「モデルBは参照訳と異なる表現でも意味が近い翻訳を生成している可能性がある」です。BLEUは単語やn-gramの一致を重視するため、自然な言い換えでもスコアが低くなる場合があります。一方、BERTScoreは意味的な類似性を評価するため、異なる表現でも意味が近ければ高く評価されます。 選択肢「モデルBは必ずモデルAより翻訳品質が低い」は誤りです。BLEUとBERTScoreは評価基準が異なり、BLEUスコアが低いだけで翻訳品質が劣るとは断言できません。 選択肢「モデルAは回帰問題でより高い精度を示している」は誤りです。BLEUやBERTScoreは自然言語処理の評価指標であり、回帰問題とは無関係です。 選択肢「モデルBは分類問題に特化したモデルである」は誤りです。BERTScoreは評価指標であり、モデルの種類や専門領域を示すものではありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る