AIFAIとMLの基礎

自然言語処理モデルを評価する際、人間による評価を実施する最大の理由として最も適切なものはどれですか。

A
自然さや文脈の妥当性など、自動評価だけでは測れない品質を確認できる
✓ 正解
生成AIでは自然さや有用性などを人間が評価することで、自動評価では見つからない品質上の問題を把握できます。
B
BLEUスコアを自動計算するため
BLEUは自動評価指標であり、人間評価を実施する理由ではありません。
C
GPU使用率を測定するため
GPU使用率はインフラの利用状況を示すものであり、生成品質とは無関係です。
D
モデルサイズを比較するため
モデルサイズは性能に影響する場合がありますが、回答品質を直接評価する指標ではありません。

解説

BLEUなどの自動評価指標は一定の目安になりますが、文章の自然さや読みやすさ、文脈の妥当性、有用性などは人間による評価が不可欠です。そのため、実際の生成AI評価では自動評価と人間評価を組み合わせることが一般的です。GPU使用率やモデルサイズはシステム性能に関する指標であり、生成品質そのものを評価するものではありません。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
AIF の問題一覧に戻る