AIFAIとMLの基礎

ある企業は、大規模言語モデル(LLM)が次の単語をどの程度適切に予測できているかを評価したいと考えています。モデルの予測性能を測定する指標として最も適切なものはどれですか。

A
Perplexity(パープレキシティ)
✓ 正解
Perplexityは言語モデルが次の単語をどれだけ適切に予測できるかを評価する代表的な指標です。値が低いほど予測性能が高いことを示し、LLMの評価で広く利用されています。
B
BLEU
BLEUは生成された翻訳文と参照訳との一致度を評価する指標です。翻訳品質の比較には適していますが、言語モデル自体の予測能力を評価する指標ではありません。
C
ROC-AUC
ROC-AUCは二項分類モデルの識別能力を評価する指標です。LLMの次単語予測性能を測定する目的では使用されません。
D
RMSE
RMSEは回帰モデルにおける予測値と実測値の誤差を評価する指標です。文章生成や次単語予測の性能評価には適していません。

解説

正解は「Perplexity(パープレキシティ)」です。Perplexityは言語モデルが次に現れる単語をどれだけ正確に予測できるかを評価する代表的な指標であり、値が低いほど予測性能が高いことを示します。大規模言語モデルの学習や比較で広く利用されています。一方、BLEUは機械翻訳の品質評価、ROC-AUCは分類モデルの識別性能、RMSEは回帰モデルの予測誤差を評価する指標です。それぞれ対象とするタスクが異なるため、言語モデル自体の性能評価にはPerplexityが最も適しています。AWS Certified AI Practitionerでも、生成AI特有の評価指標としてPerplexityの役割を理解していることが重要です。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る