正解は「Perplexity(パープレキシティ)」です。Perplexityは言語モデルが次に現れる単語をどれだけ正確に予測できるかを評価する代表的な指標であり、値が低いほど予測性能が高いことを示します。大規模言語モデルの学習や比較で広く利用されています。一方、BLEUは機械翻訳の品質評価、ROC-AUCは分類モデルの識別性能、RMSEは回帰モデルの予測誤差を評価する指標です。それぞれ対象とするタスクが異なるため、言語モデル自体の性能評価にはPerplexityが最も適しています。AWS Certified AI Practitionerでも、生成AI特有の評価指標としてPerplexityの役割を理解していることが重要です。