機械翻訳モデルAとBを比較しています。モデルAはBLEUスコアが高く、モデルBはBERTScoreが高い結果となりました。この結果から最も適切に読み取れる内容はどれですか。
正解は「モデルBは参照訳と異なる表現でも意味が近い翻訳を生成している可能性がある」です。BLEUは単語やn-gramの一致を重視するため、自然な言い換えでもスコアが低くなる場合があります。一方、BERTScoreは意味的な類似性を評価するため、異なる表現でも意味が近ければ高く評価されます。 選択肢「モデルBは必ずモデルAより翻訳品質が低い」は誤りです。BLEUとBERTScoreは評価基準が異なり、BLEUスコアが低いだけで翻訳品質が劣るとは断言できません。 選択肢「モデルAは回帰問題でより高い精度を示している」は誤りです。BLEUやBERTScoreは自然言語処理の評価指標であり、回帰問題とは無関係です。 選択肢「モデルBは分類問題に特化したモデルである」は誤りです。BERTScoreは評価指標であり、モデルの種類や専門領域を示すものではありません。